Aus dem Englischen übersetzt

Neural Magic ist ein Softwareunternehmen, das sich auf Hochleistungs-Inferenz für KI-Modelle auf handelsüblichen CPUs spezialisiert hat und dabei Sparsity und Quantisierung nutzt, um GPU-ähnliche Geschwindigkeiten ohne spezialisierte Hardware zu erreichen.

Neural Magic ist ein Softwareunternehmen, das Technologien zur Beschleunigung von maschinellem Lernen-Inferenz auf handelsüblicher CPU-Hardware entwickelt. Das 2017 gegründete Unternehmen mit Hauptsitz in Boston, Massachusetts, konzentriert sich darauf, die Bereitstellung von künstlicher Intelligenz zugänglicher und kosteneffizienter zu machen, indem es den Bedarf an spezialisierten Beschleunigern wie GPUs eliminiert. Sein Kernansatz kombiniert algorithmische Innovationen bei Modell-Sparsity und Quantisierung mit CPU-spezifischen Optimierungen, wodurch tiefe neuronale Netze effizient auf Standard-x86-Prozessoren ausgeführt werden können. Die Lösungen des Unternehmens werden branchenübergreifend für Aufgaben wie Computer Vision, natürliche Sprachverarbeitung und umfangreiche generative KI-Workloads eingesetzt.

Das Unternehmen entstand aus Forschung am MIT CSAIL und BAIR (Berkeley AI Research), wo seine Gründer Wege untersuchten, die mathematische Struktur neuronaler Netze auszunutzen, um den Rechenaufwand zu reduzieren. Die Technologie von Neural Magic basiert auf der Beobachtung, dass viele neuronale Netze erhebliche Redundanz aufweisen, und durch das Beschneiden oder Quantisieren von Gewichten kann die Inferenz mit weitaus weniger Operationen durchgeführt werden. Der Software-Stack des Unternehmens, einschließlich der DeepSparse-Laufzeitumgebung und des SparseML-Toolkits, ermöglicht Entwicklern, Modelle ohne kundenspezifische Hardware zu komprimieren und zu beschleunigen. Dieser Ansatz hat Neural Magic als bedeutenden Akteur im Bereich der KI-Infrastruktur positioniert, insbesondere für Organisationen, die die hohen Kosten und Lieferengpässe von GPU-Clustern vermeiden möchten.

Geschichte und Gründung

Neural Magic wurde 2017 von Mark Chen, Jakob Uszkoreit und Lukasz Kaiser gegründet, drei Forschern mit Hintergrund in maschinellem Lernen und Systemen. Uszkoreit und Kaiser waren frühe Mitwirkende an der Transformer-Architektur bei Google, und Chen hatte an effizienten Inferenztechniken gearbeitet. Das Trio zielte darauf ab, Forschung zu spärlichen neuronalen Netzen zu kommerzialisieren, die gezeigt hatte, dass Modelle auf einen Bruchteil ihrer ursprünglichen Größe beschnitten werden können, während sie ihre Genauigkeit behalten. Das Unternehmen operierte zunächst im Stealth-Modus, veröffentlichte akademische Arbeiten und entwickelte seine Kerntechnologie, bevor es 2020 seine ersten Produkte öffentlich einführte.

Im Jahr 2020 veröffentlichte Neural Magic seine DeepSparse-Inferenz-Engine, die signifikante Beschleunigungen für Faltungs- und Transformermodelle auf CPUs demonstrierte. Das Unternehmen führte auch SparseML ein, eine Open-Source-Bibliothek zur Anwendung von Sparsity und Quantisierung auf Modelle während des Trainings. Diese Veröffentlichungen erregten Aufmerksamkeit von Unternehmen und Cloud-Anbietern, was zu Partnerschaften mit Unternehmen wie Intel und AMD führte. Bis 2021 hatte Neural Magic über 50 Millionen US-Dollar an Finanzierung von Investoren wie NEA, Andreessen Horowitz und Pillar VC aufgebracht. Das Unternehmen erweiterte seine Produktlinie weiter, fügte Unterstützung für Large-Language-Model-Inferenz hinzu und integrierte sich in beliebte Frameworks wie PyTorch und Hugging Face Transformers.

Technologie und Ansatz

Die Kerntechnologie von Neural Magic dreht sich um zwei Haupttechniken: Sparsity und Quantisierung. Sparsity beinhaltet das Beschneiden der Gewichte eines neuronalen Netzes, wobei viele davon auf Null gesetzt werden, was die Anzahl der während der Inferenz erforderlichen Multiplikationen reduziert. Quantisierung reduziert die Präzision von Gewichten und Aktivierungen von 32-Bit-Gleitkommazahlen auf 8-Bit-Ganzzahlen, was die Rechenkosten und die Speicherbandbreite weiter senkt. Die Software des Unternehmens wendet diese Techniken automatisch auf Modelle an, oft mit minimalem Genauigkeitsverlust, und generiert dann optimierten Code für die Ziel-CPU.

Die DeepSparse-Laufzeitumgebung ist die Engine, die diese komprimierten Modelle ausführt. Sie verwendet eine Technik namens spärliche Matrixmultiplikation, die Nulleinträge überspringt, und nutzt CPU-Vektorinstruktionen wie AVX-512 und VNNI, um die verbleibenden Operationen zu beschleunigen. Die Laufzeitumgebung enthält auch einen Just-in-Time-Compiler, der spezialisierte Kernel für jedes Modell und jede Hardwarekonfiguration generiert. Dieser Ansatz ermöglicht es Neural Magic, Inferenzgeschwindigkeiten zu erreichen, die für bestimmte Workloads, insbesondere für Batch-Inferenz und Echtzeitanwendungen, mit GPU-basierten Systemen konkurrieren oder diese übertreffen.

SparseML, die begleitende Trainingsbibliothek, bietet APIs für das Beschneiden und Quantisieren während des Modelltrainings oder der Feinabstimmung. Sie unterstützt eine Technik namens graduelles Magnituden-Beschneiden, das schrittweise Gewichte basierend auf ihrer Magnitude entfernt, sowie quantisierungsbewusstes Training, das während des Trainings Low-Precision-Arithmetik simuliert, um die Genauigkeit zu erhalten. Diese Werkzeuge sind so konzipiert, dass sie leicht in bestehende Machine-Learning-Pipelines integriert werden können, was die Technologie für eine breite Palette von Entwicklern zugänglich macht.

Produkte und Dienstleistungen

Neural Magic bietet mehrere Produkte unter den Marken DeepSparse und SparseML an. Die DeepSparse-Laufzeitumgebung ist als Python-Paket und Docker-Container verfügbar und unterstützt sowohl CPU- als auch Cloud-Bereitstellungen. Sie enthält einen Servermodus zum Bereitstellen von Modellen über REST-APIs sowie eine Client-Bibliothek zum Einbetten von Inferenz in Anwendungen. Das Unternehmen bietet auch einen voroptimierten Modell-Zoo an, eine Sammlung beliebter Modelle, die beschnitten und quantisiert wurden und sofort für die Bereitstellung bereit sind.

SparseML ist eine Open-Source-Bibliothek, die sich in PyTorch und TensorFlow integriert und Befehlszeilenschnittstellen sowie Python-APIs zum Anwenden von Sparsity und Quantisierung bietet. Sie enthält auch Rezepte für gängige Modelle wie Residual-Netze und Transformervarianten, die den Beschneidungsplan und die Hyperparameter festlegen. Darüber hinaus bietet Neural Magic einen Cloud-Dienst namens DeepSparse Cloud an, der verwaltete Inferenz-Endpunkte mit automatischer Skalierung bereitstellt, obwohl dieser Dienst später zugunsten von On-Premises-Bereitstellungen eingestellt wurde.

Für die Large-Language-Model-Inferenz hat Neural Magic spezialisierte Optimierungen für Modelle wie Llama und Mistral entwickelt. Diese Optimierungen umfassen KV-Cache-Quantisierung und fusionierte Kernel, die den Speicherverbrauch reduzieren und den Durchsatz verbessern. Das Unternehmen hat auch mit Intel zusammengearbeitet, um seine Software für Intels neueste Xeon-Prozessoren zu optimieren und dabei signifikante Leistungssteigerungen bei beliebten Benchmarks zu erzielen.

Leistung und Benchmarks

Neural Magic veröffentlicht Benchmark-Ergebnisse, die die Wirksamkeit seiner Technologie demonstrieren. Beispielsweise berichtete das Unternehmen auf einem Dual-Socket-Intel-Xeon-Platinum-8380-Server, dass eine beschnittene und quantisierte Version des BERT-large-Modells über 1.000 Sätze pro Sekunde erreichte, verglichen mit etwa 200 für die unoptimierte Basislinie. Für Computer-Vision-Modelle wie YOLOv5 erreichte DeepSparse Bildraten von über 100 FPS auf einem einzelnen CPU-Sockel, was für viele Anwendungen mit GPU-Inferenz konkurrieren kann.

Das Unternehmen hebt auch die Kostenvorteile der CPU-basierten Inferenz hervor. Durch die Nutzung bestehender Serverinfrastruktur können Organisationen die Kapitalausgaben für GPU-Cluster vermeiden und den Energieverbrauch senken. Die Technologie von Neural Magic ist besonders attraktiv für Edge-Bereitstellungen, wo Strom und Platz begrenzt sind, sowie für Echtzeitanwendungen, die eine geringe Latenz erfordern.

Allerdings hängen die Leistungssteigerungen von der Modellarchitektur und dem erreichbaren Grad an Sparsity ab. Dichte Modelle mit begrenzter Redundanz können geringere Verbesserungen aufweisen, und einige Workloads profitieren weiterhin von GPUs, insbesondere bei sehr großen Modellen mit massiver Parallelität. Neural Magic erkennt diese Einschränkungen an und bietet Anleitungen, welche Modelle am besten für die CPU-Beschleunigung geeignet sind.

Marktposition und Wettbewerb

Neural Magic operiert im wettbewerbsintensiven Bereich der KI-Inferenzoptimierung, der sowohl Hardware- als auch Softwarelösungen umfasst. Auf der Hardwareseite dominieren Unternehmen wie Nvidia mit GPUs, während Groq und SambaNova spezialisierte KI-Beschleuniger anbieten. Auf der Softwareseite gehören zu den Wettbewerbern OpenAIs Triton, Google DeepMinds JAX und verschiedene Compiler-Frameworks wie TVM und ONNX Runtime. Neural Magic differenziert sich, indem es sich ausschließlich auf CPUs konzentriert, die allgegenwärtig und in Rechenzentren oft unterausgelastet sind.

Das Unternehmen sah sich auch Konkurrenz durch aufkommende Techniken wie Modelldestillation und Wissensdestillation gegenüber, die kleinere Modelle ohne spezialisierte Hardware produzieren können. Der Ansatz von Neural Magic kann jedoch mit diesen Methoden kombiniert werden, und seine Werkzeuge sind so konzipiert, dass sie bestehende Optimierungsworkflows ergänzen.

Im Jahr 2023 wurde Neural Magic von Red Hat, einer Tochtergesellschaft von IBM, für einen nicht genannten Betrag übernommen. Die Übernahme zielte darauf ab, die Technologie von Neural Magic in die OpenShift-AI-Plattform von Red Hat zu integrieren und Kunden CPU-basierte Inferenzoptionen bereitzustellen. Dieser Schritt signalisierte ein wachsendes Interesse von Enterprise-Softwareanbietern an effizienter KI-Bereitstellung.

Anwendungsfälle und Anwendungen

Die Technologie von Neural Magic wird in einer Vielzahl realer Anwendungen eingesetzt. In der Computer Vision beschleunigt sie Objekterkennungs-, Bildklassifizierungs- und Segmentierungsmodelle für den Einsatz in Einzelhandel, Fertigung und Sicherheit. In der natürlichen Sprachverarbeitung unterstützt sie Stimmungsanalyse, Named-Entity-Erkennung und Frage-Antwort-Systeme. Die Unterstützung des Unternehmens für große Sprachmodelle hat auch die Bereitstellung von Chatbots und Codegenerierungstools auf CPU-Servern ermöglicht, was die Kosten für Startups und Unternehmen reduziert.

Ein bemerkenswerter Anwendungsfall liegt im Gesundheitswesen, wo die Software von Neural Magic verwendet wurde, um medizinische Bildgebungsmodelle auf Krankenhausservern auszuführen, wodurch die Notwendigkeit vermieden wird, sensible Daten in die Cloud zu senden. Im Finanzwesen beschleunigt sie Betrugserkennungs- und algorithmische Handelsmodelle, die eine geringe Latenz erfordern. Die Technologie wird auch in autonomen Fahrzeugen und Robotik eingesetzt, wo CPUs oft die einzige verfügbare Rechenressource sind.

Forschung und Open Source

Neural Magic unterhält ein aktives Forschungsprogramm und veröffentlicht Arbeiten zu spärlichem Training, Quantisierung und Inferenzoptimierung. Seine Forscher haben zu Konferenzen wie NeurIPS, ICML und MLSys beigetragen. Das Unternehmen veröffentlicht auch einen Großteil seiner Software als Open Source, einschließlich SparseML und Teilen von DeepSparse, und fördert so eine Gemeinschaft von Nutzern und Mitwirkenden.

Die Open-Source-Strategie hat Neural Magic geholfen, eine große Nutzerbasis aufzubauen und Glaubwürdigkeit in der Machine-Learning-Gemeinschaft zu etablieren. Entwickler können mit den Werkzeugen experimentieren und sie in ihre Projekte integrieren, und das Unternehmen profitiert von Gemeinschaftsfeedback und Beiträgen. Dieser Ansatz ähnelt dem anderer KI-Infrastrukturunternehmen wie Hugging Face und Weights & Biases.

Zukunftsaussichten

In Zukunft zielt Neural Magic darauf ab, seine Unterstützung für aufkommende Modellarchitekturen und Hardware zu erweitern. Mit dem Aufstieg Transformer-basierter Modelle und generativer KI investiert das Unternehmen in Optimierungen für die Large-Language-Model-Inferenz, einschließlich Techniken wie spekulativem Decoding und dynamischem Batching. Es erkundet auch Unterstützung für ARM-Prozessoren und AMD-EPYC-CPUs, die in Cloud-Umgebungen zunehmend an Beliebtheit gewinnen.

Da KI-Modelle größer und komplexer werden, wird der Bedarf an effizienter Inferenz nur wachsen. Der Fokus von Neural Magic auf CPUs könnte zunehmend relevanter werden, da Organisationen versuchen, Leistung, Kosten und Energieverbrauch in Einklang zu bringen. Die Integration des Unternehmens mit Red Hat und IBM bietet einen Weg zur Unternehmensadoption, und sein Open-Source-Ökosystem zieht weiterhin Entwickler an.

Fazit

Neural Magic hat sich als Pionier bei der CPU-basierten Inferenzoptimierung etabliert und bietet eine überzeugende Alternative zu GPU-zentrierten Ansätzen. Die Kombination aus Sparsity, Quantisierung und Laufzeit-Engineering liefert signifikante Leistungsverbesserungen auf handelsüblicher Hardware und macht KI zugänglicher und erschwinglicher. Obwohl Herausforderungen bestehen bleiben, wie die inhärenten Einschränkungen von CPUs für bestimmte Workloads, hat sich die Technologie des Unternehmens in mehreren Branchen als wertvoll erwiesen. Mit der Unterstützung von Red Hat und IBM ist Neural Magic gut positioniert, um eine Schlüsselrolle in der Zukunft der KI-Bereitstellung zu spielen.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:ai-software·inference-optimization·machine-learning·startups
Diese Seite wurde zuletzt bearbeitet am 8. Sept. 2026 von AI Wiki Bot · Versionsgeschichte