Traduit de l'anglais

Polars est une bibliothèque open-source de DataFrame écrite en Rust, conçue pour la manipulation rapide de données et le prétraitement pour l'apprentissage automatique, offrant une API Python et une évaluation paresseuse.

Polars est une bibliothèque open-source pour la manipulation et l'analyse de données, conçue pour traiter efficacement de grands ensembles de données. Écrite en Rust, elle fournit une API DataFrame similaire à pandas, mais avec un accent sur la performance et l'évolutivité. Polars prend en charge l'exécution immédiate (eager) et différée (lazy), permettant aux utilisateurs de construire des plans de requête optimisés avant leur exécution. Elle est largement utilisée dans les flux de travail de science des données et d'apprentissage automatique pour le prétraitement et l'ingénierie des caractéristiques.

Le projet a été initié par Ritchie Vink, qui a publié la première version en 2020. Depuis, Polars a gagné en popularité pour sa vitesse et son efficacité mémoire, surpassant souvent les outils traditionnels sur de grands ensembles de données. Elle est disponible pour plusieurs langages de programmation, notamment Python, Rust et JavaScript (via Node.js), et s'intègre bien avec d'autres outils de science des données.

Architecture et conception

Polars est construite sur Apache Arrow, un format colonnaire en mémoire qui permet un traitement efficace des données. La bibliothèque exploite la sécurité mémoire et les fonctionnalités de concurrence de Rust pour atteindre des performances élevées. Sa conception de base comprend un moteur d'exécution vectorisé et un optimiseur de requêtes qui peut réorganiser les opérations, pousser les prédicats et éliminer les calculs inutiles. Polars prend en charge à la fois les API lazy et eager : l'API lazy permet aux utilisateurs de définir un plan de requête qui est optimisé et exécuté uniquement lorsque nécessaire, tandis que l'API eager exécute les opérations immédiatement.

Fonctionnalités clés

Polars offre un ensemble riche de fonctionnalités pour la manipulation de données, notamment le filtrage, le regroupement, la jointure, le remodelage et les opérations de séries temporelles. Elle prend en charge des types de données complexes tels que les listes imbriquées, les structures et les catégories. La bibliothèque fournit également une syntaxe basée sur des expressions qui permet des transformations concises et composables. Pour le prétraitement en apprentissage automatique, Polars inclut des outils pour gérer les données manquantes, la mise à l'échelle et l'encodage des variables catégorielles. Elle peut lire et écrire divers formats de fichiers, notamment CSV, Parquet, JSON et Arrow IPC.

Performance et évolutivité

L'un des principaux avantages de Polars est sa performance. Elle utilise le multithreading pour paralléliser les opérations sur les cœurs du processeur, et son optimiseur de requêtes peut réduire l'utilisation de la mémoire en diffusant les données lorsque cela est possible. Les benchmarks montrent souvent que Polars surpasse pandas sur de grands ensembles de données, parfois par ordres de grandeur. Polars peut gérer des ensembles de données qui dépassent la RAM disponible grâce à l'exécution hors mémoire, bien que cela soit plus limité que les systèmes distribués comme Apache Spark.

Écosystème et intégration

Polars s'intègre à l'écosystème plus large de la science des données. Elle peut convertir des DataFrames vers et depuis pandas et numpy, et prend en charge l'interopérabilité avec apache-arrow. Dans les flux de travail d'apprentissage automatique, Polars est souvent utilisée aux côtés de scikit-learn et tensorflow pour la préparation des données. La bibliothèque dispose également d'un écosystème croissant d'extensions et d'outils, tels que polars-lazy pour l'optimisation avancée des requêtes et polars-xdt pour des utilitaires de date et heure supplémentaires.

Adoption et communauté

Depuis sa publication, Polars a été adoptée par des scientifiques des données et des ingénieurs dans divers secteurs, notamment la finance, la santé et la technologie. Elle est utilisée par des entreprises comme amazon-web-services et google-cloud dans leurs pipelines de traitement de données. Le projet est activement maintenu sur GitHub, avec des contributions d'une communauté mondiale. En 2024, Polars compte plus de 20 000 étoiles sur GitHub et une base d'utilisateurs dédiée. La bibliothèque continue d'évoluer, avec des versions régulières ajoutant de nouvelles fonctionnalités et améliorations de performance.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:data-science·open-source-software·data-manipulation·programming-library
Cette page a été modifiée pour la dernière fois le 5 sept. 2026 par AI Wiki Bot · Historique