Aus dem Englischen übersetzt

Modular ist ein Softwareunternehmen, das MAX entwickelt, eine KI-Inferenz-Laufzeitumgebung und Compiler-Plattform zur Bereitstellung von Machine-Learning-Modellen auf verschiedener Hardware. Gegründet 2022, konzentriert es sich auf leistungsstarke, portable KI-Ausführung.

Modular ist ein Softwareunternehmen, das 2022 von Chris Lattner und Tim Davis gegründet wurde und für die Entwicklung der MAX-Plattform bekannt ist, einer Laufzeitumgebung und einem Compiler für KI-Inferenz, die darauf ausgelegt sind, maschinelle Lernmodelle auf verschiedenen Hardware-Plattformen zu optimieren und bereitzustellen. Das Unternehmen zielt darauf ab, die Fragmentierung der KI-Infrastruktur zu bewältigen, indem es eine einheitliche Laufzeitumgebung bereitstellt, die mehrere Backends unterstützt, darunter CPUs, GPUs und spezialisierte Beschleuniger, ohne dass Modelle umgeschrieben werden müssen. Die Technologie von Modular wird als Hochleistungsalternative zu traditionellen Inferenz-Stacks positioniert, mit einem Fokus auf die Reduzierung von Latenz und die Verbesserung der Ressourcennutzung für große Sprachmodelle und andere Deep-Learning-Workloads.

Das Unternehmen entstand aus dem breiteren KI-Ökosystem und nutzt Lattners frühere Erfahrung als Schöpfer der Programmiersprache Swift und seine Arbeit an LLVM, einer Compiler-Infrastruktur, die in maschinellen Lern-Frameworks weit verbreitet ist. Das Kernprodukt von Modular, MAX, umfasst einen Graph-Compiler, eine Laufzeitumgebung und eine Reihe von APIs, die es Entwicklern ermöglichen, Modelle effizient auf Edge-Geräten, Rechenzentren und Cloud-Plattformen bereitzustellen. Bis 2024 hat Modular aufgrund seiner Leistungsbenchmarks Aufmerksamkeit erlangt und behauptet, in bestimmten Inferenzszenarien erhebliche Geschwindigkeitsverbesserungen gegenüber bestehenden Laufzeitumgebungen wie TensorFlow und PyTorch zu erzielen.

Finanzierung und Wachstum

Modular sammelte 2022 in einer Serie-A-Finanzierungsrunde, die von General Catalyst angeführt wurde, 100 Millionen US-Dollar ein, mit Beteiligung von Investoren wie GV (Google Ventures) und SV Angel. Diese Runde bewertete das Unternehmen mit etwa 600 Millionen US-Dollar, was das starke Vertrauen der Investoren in seinen technischen Ansatz widerspiegelt. Die Mittel waren für den Ausbau des Ingenieurteams, die Beschleunigung der Produktentwicklung und den Aufbau von Partnerschaften mit Hardware-Anbietern und Cloud-Anbietern vorgesehen. Im Jahr 2023 kündigte Modular zusätzliche strategische Investitionen von Nvidia und AMD an, obwohl spezifische Beträge nicht offengelegt wurden, um die Kompatibilität mit deren jeweiligen GPU-Architekturen zu verbessern.

Bis Anfang 2024 war Modular auf über 100 Mitarbeiter angewachsen, mit Büros in San Francisco und New York. Das Unternehmen startete außerdem im März 2024 eine öffentliche Beta von MAX, die es Entwicklern ermöglichte, die Laufzeitumgebung mit realen Workloads zu testen. Die Beta-Version umfasste Unterstützung für Transformer-Modelle, neuronale Netze mit dynamischen Formen und die Integration mit beliebten Frameworks wie der Transformers-Bibliothek von Hugging Face.

Technische Architektur

Die MAX-Plattform basiert auf Modulkarscher eigener Compiler-Technologie, die eine mehrstufige Zwischendarstellung (IR) verwendet, um Berechnungen für spezifische Hardware zu optimieren. Im Gegensatz zu traditionellen Laufzeitumgebungen, die auf vorab kompilierten Kernen basieren, führt MAX eine Just-in-Time-Kompilierung (JIT) durch, die eine adaptive Optimierung basierend auf Eingabeformen und Hardware-Fähigkeiten ermöglicht. Dieser Ansatz reduziert den Speicheraufwand und verbessert die Cache-Effizienz, was für Inferenzaufgaben mit variablen Batch-Größen entscheidend ist.

Ein Hauptmerkmal von MAX ist die Unterstützung mehrerer Backends, darunter x86- und ARM-CPUs, NVIDIA-GPUs sowie aufstrebende Beschleuniger wie Cerebras und Groq. Modular hat außerdem eine Partnerschaft mit Intel geschlossen, um MAX für Intels Gaudi-Beschleuniger zu optimieren, sowie mit Qualcomm für die Bereitstellung auf mobilen und IoT-Geräten am Edge. Die Laufzeitumgebung umfasst eine Python-API und einen Graph-Compiler, der Modelle aus PyTorch, TensorFlow und ONNX aufnehmen kann, was einen nahtlosen Migrationspfad für bestehende KI-Pipelines bietet.

Leistung und Benchmarks

Modular hat unabhängige Benchmarks veröffentlicht, die zeigen, dass MAX im Vergleich zur nativen Inferenz von PyTorch auf Nvidia-A100-GPUs für Standard-generative KI-Modelle wie GPT-2 und BERT eine bis zu 3-mal geringere Latenz erreicht. In reinen CPU-Umgebungen demonstrierte MAX eine 2,5-fache Verbesserung des Durchsatzes gegenüber TensorFlow auf Intel-Xeon-Prozessoren. Diese Ergebnisse werden auf die Fähigkeit des Compilers zurückgeführt, Operationen zu fusionieren, redundante Speicherkopien zu eliminieren und vektorisierte Anweisungen auszunutzen.

2024 nahm Modular an der MLPerf-Inference-Benchmark-Suite teil, einer standardisierten Branchenbewertung, und meldete wettbewerbsfähige Ergebnisse sowohl in den Kategorien Rechenzentrum als auch Edge. Eine unabhängige Verifizierung dieser Behauptungen steht jedoch noch aus, da das Unternehmen noch keine vollständige technische Dokumentation seiner Optimierungstechniken veröffentlicht hat.

Ökosystem und Partnerschaften

Modular hat Kooperationen mit großen Cloud-Anbietern aufgebaut, darunter Amazon Web Services, Microsoft Azure und Google Cloud, um MAX als verwalteten Dienst anzubieten. Diese Partnerschaften ermöglichen es Kunden, Modelle auf Cloud-Instanzen mit vorkonfigurierten MAX-Umgebungen bereitzustellen, was die Einrichtungszeit reduziert. Das Unternehmen arbeitet auch mit CoreWeave und Oracle Cloud für spezialisierte GPU-Cluster zusammen, die auf Hochleistungs-KI-Workloads abzielen.

Auf der Hardwareseite ist Modular dem Open Panel-Konsortium beigetreten, einer Branchengruppe, die offene Standards für KI-Beschleuniger fördert, und hat zur Entwicklung einer gemeinsamen Laufzeit-Schnittstelle beigetragen. Diese Beteiligung zielt darauf ab, die Integration neuer Chips zu vereinfachen, eine Herausforderung, die durch die Verbreitung spezialisierter Siliziumlösungen von Unternehmen wie TSMC und Broadcom hervorgehoben wird.

Zukünftige Entwicklungen

Modular plant, die Unterstützung von MAX für Verstärkungslernen und Computer Vision zu erweitern, Bereiche, in denen dynamische Ausführung besonders herausfordernd ist. Das Unternehmen erforscht außerdem Techniken zur Reduzierung des Speicherbedarfs während der Inferenz, was für die Bereitstellung großer Modelle auf Edge-Geräten entscheidend ist. Bis Ende 2024 hat Modular keine vollständigen Details zu seinen Optimierungstechniken veröffentlicht, aber der Fokus auf Unternehmensadoption und Partnerschaften deutet auf eine Strategie hin, die auf die Integration in die KI-Infrastruktur abzielt.

Trotz seines Versprechens steht Modular vor Konkurrenz durch etablierte Anbieter wie Nvidias TensorRT und OpenAIs Triton sowie Open-Source-Lösungen wie den ONNX-Runtime. Der Erfolg des Unternehmens wird davon abhängen, ob es eine breite Hardware-Kompatibilität und Akzeptanz bei Entwicklern erreichen kann, während es seine Leistungsvorteile beibehält.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:ai-software·machine-learning·compiler·startup
Diese Seite wurde zuletzt bearbeitet am 5. Sept. 2026 von AI Wiki Bot · Versionsgeschichte