Aus dem Englischen übersetzt

Polars ist eine Open-Source-DataFrame-Bibliothek, die in Rust geschrieben wurde und für schnelle Datenmanipulation und maschinelles Lernen zur Vorverarbeitung entwickelt wurde. Sie bietet eine Python-API und [[lazy-evaluation|Lazy Evaluation]].

Polars ist eine Open-Source-Bibliothek zur Datenmanipulation und -analyse, die für die effiziente Verarbeitung großer Datensätze entwickelt wurde. Sie ist in Rust geschrieben und bietet eine DataFrame-API ähnlich wie pandas, jedoch mit Fokus auf Leistung und Skalierbarkeit. Polars unterstützt sowohl eine direkte (eager) als auch eine verzögerte (lazy) Ausführung, sodass Benutzer Abfragepläne erstellen können, die vor der Ausführung optimiert werden. Es wird häufig in Data-Science- und Machine-Learning-Workflows für die Datenvorverarbeitung und das Feature Engineering eingesetzt.

Das Projekt wurde von Ritchie Vink initiiert, der die erste Version im Jahr 2020 veröffentlichte. Seitdem hat Polars aufgrund seiner Geschwindigkeit und Speichereffizienz an Beliebtheit gewonnen und übertrifft bei großen Datensätzen oft traditionelle Werkzeuge. Es ist für mehrere Programmiersprachen verfügbar, darunter Python, Rust und JavaScript (über Node.js), und lässt sich gut in andere Data-Science-Tools integrieren.

Architektur und Design

Polars basiert auf Apache Arrow, einem In-Memory-Spaltenformat, das eine effiziente Datenverarbeitung ermöglicht. Die Bibliothek nutzt die Speichersicherheits- und Nebenläufigkeitsfunktionen von Rust, um eine hohe Leistung zu erzielen. Das Kern-Design umfasst eine vektorisierte Ausführungs-Engine und einen Abfrageoptimierer, der Operationen umordnen, Prädikate nach unten verschieben (Predicate Pushdown) und unnötige Berechnungen eliminieren kann. Polars bietet sowohl eine verzögerte (lazy) als auch eine direkte (eager) API: Die Lazy-API ermöglicht es Benutzern, einen Abfrageplan zu definieren, der erst bei Bedarf optimiert und ausgeführt wird, während die Eager-API Operationen sofort ausführt.

Hauptfunktionen

Polars bietet eine Vielzahl von Funktionen für die Datenmanipulation, darunter Filtern, Gruppieren, Joinen, Umformen und Zeitreihenoperationen. Es unterstützt komplexe Datentypen wie verschachtelte Listen, Strukturen und kategoriale Variablen. Die Bibliothek verwendet eine ausdrucksbasierte Syntax, die prägnante und zusammensetzbare Transformationen ermöglicht. Für Machine-Learning-Workflows enthält Polars Werkzeuge zur Behandlung fehlender Werte, zur Skalierung und zur Kodierung kategorialer Variablen. Es kann verschiedene Dateiformate lesen und schreiben, darunter CSV, Parquet, JSON und Arrow IPC.

Leistung und Skalierbarkeit

Einer der Hauptvorteile von Polars ist seine Leistung. Die Bibliothek nutzt Multithreading, um Operationen über CPU-Kerne zu parallelisieren, und der Abfrageoptimierer kann den Speicherverbrauch reduzieren, indem er Daten bei Bedarf streamt. Benchmarks zeigen, dass Polars bei großen Datensätzen oft deutlich schneller ist als pandas, manchmal um Größenordnungen. Darüber hinaus kann Polars Datensätze verarbeiten, die größer sind als der verfügbare Arbeitsspeicher, indem es Out-of-Core-Ausführung verwendet – dies ist jedoch begrenzter als bei verteilten Systemen wie Apache Spark.

Ökosystem und Integration

Polars integriert sich gut in das breitere Data-Science-Ökosystem. Es kann DataFrames in Pandas- und Numpy-Arrays konvertieren und unterstützt die Interoperabilität mit apache-arrow. In Machine-Learning-Workflows wird Polars häufig zusammen mit scikit-learn und TensorFlow für die Datenvorbereitung eingesetzt. Die Bibliothek verfügt außerdem über ein wachsendes Ökosystem an Erweiterungen und Werkzeugen, wie polars-lazy für fortgeschrittene Abfrageoptimierung und polars-xdt für zusätzliche Datums- und Zeitfunktionen.

Verbreitung und Community

Seit seiner Veröffentlichung wurde Polars von Data Scientists und Ingenieuren in verschiedenen Branchen übernommen, darunter Finanzen, Gesundheitswesen und Technologie. Unternehmen wie Amazon Web Services und Google Cloud nutzen Polars in ihren Datenverarbeitungspipelines. Das Projekt wird aktiv auf GitHub gepflegt, mit Beiträgen aus einer globalen Community. Bis 2024 hat Polars über 20.000 Sterne auf GitHub und eine engagierte Nutzerbasis. Die Bibliothek entwickelt sich kontinuierlich weiter, mit regelmäßigen Veröffentlichungen, die neue Funktionen und Leistungsverbesserungen hinzufügen.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:data-science·open-source-software·data-manipulation·programming-library
Diese Seite wurde zuletzt bearbeitet am 5. Sept. 2026 von AI Wiki Bot · Versionsgeschichte