Untether AI ist ein kanadisches Halbleiterunternehmen, das energieeffiziente KI-Inferenzchips für Edge-Computing-Anwendungen entwickelt. Das 2019 gegründete und in Toronto ansässige Unternehmen entwickelt Prozessoren, die für den Betrieb trainierter neuronaler Netze mit minimalem Stromverbrauch und minimaler Latenz optimiert sind, und zielt auf Anwendungsfälle wie autonome Fahrzeuge, industrielle Automatisierung und Echtzeit-Inferenz in Rechenzentren ab. Das Unternehmen entstand aus Forschung an der University of Toronto und positionierte sich schnell im breiteren Hardware-Ökosystem für künstliche Intelligenz, wo es mit anderen spezialisierten Chipherstellern wie Groq und Graphcore konkurriert, wobei der Fokus auf der Bereitstellung statt dem Training von KI-Modellen liegt.
Die Kerntechnologie des Unternehmens basiert auf einer neuartigen Speicherarchitektur, die die Energiekosten für den Datentransfer zwischen Verarbeitungselementen und Speicher reduziert – ein Engpass in der konventionellen Von-Neumann-Computerarchitektur. Im Jahr 2019 sammelte Untether AI 19 Millionen US-Dollar in einer Seed-Runde unter der Leitung von Radical Ventures und Draper Associates ein und sicherte sich später im Oktober 2022 eine Serie-B-Finanzierung in Höhe von 175 Millionen US-Dollar, die gemeinsam vom kanadischen Public Sector Pension Investment Board und dem Samsung Catalyst Fund geleitet wurde, wodurch sich die Gesamtfinanzierung auf über 200 Millionen US-Dollar belief. Das Unternehmen lieferte sein erstes kommerzielles Produkt, den speedAI240, im Jahr 2023 aus, obwohl die Produktionsmengen schrittweise anstiegen.
Gründung und frühe Entwicklung
Untether AI wurde von Arun Subramaniyan, der zuvor die Data-Center-Chip-Engineering-Abteilung bei Intel leitete, und Martino Andreani, einem Systemarchitekten mit Hintergrund bei AMD, mitbegründet. Die beiden lernten sich durch eine Forschungskooperation an der University of Toronto kennen, wo sie unter Professor Andreas Moshovos an energieeffizienten Deep-Learning-Beschleunigern arbeiteten. Ihr erstes Konzept, das 2017 veröffentlicht wurde, schlug vor, Speicher auf das Verarbeitungsgerät zu verlagern, um externen DRAM-Zugriff für Inferenz zu eliminieren.
Im Jahr 2020 kündigte das Unternehmen eine Partnerschaft mit TSMC an, um seine Chips in einem 7-Nanometer-Prozess zu fertigen, wobei das erste Silizium Anfang 2021 fertiggestellt wurde. Bis Mitte 2022 beschäftigte Untether AI etwa 120 Mitarbeiter an Standorten in Toronto und Ottawa, mit geplanten Engineering-Zentren auch in San Jose. Das frühe Wachstum des Unternehmens profitierte von kanadischer Regierungsunterstützung, einschließlich eines Beitrags von 4 Millionen US-Dollar aus dem Strategic Innovation Fund im Jahr 2021.
Architektur und Technologie
Die wichtigste Innovation in den Chips von Untether AI ist ihr „At-Memory-Computing“-Ansatz, bei dem Recheneinheiten direkt neben SRAM-Speicherarrays auf dem Die platziert werden. Diese Anordnung eliminiert die Notwendigkeit, Daten für jede Operation über einen Systembus zu transportieren, was den Stromverbrauch im Vergleich zu herkömmlichen Beschleunigern erheblich reduziert. Die Architektur verwendet ein Dataflow-ähnliches Ausführungsmodell, bei dem Gewichte und Aktivierungen im lokalen Speicher verbleiben und die Berechnung jedes Neurons am Speicherort erfolgt.
Der speedAI240-Prozessor enthält 256 Rechenkerne mit jeweils 2 MB SRAM und erreicht 2 Peta-Operationen pro Sekunde (POPS) bei 8-Bit-Ganzzahlgenauigkeit bei einem Stromverbrauch von etwa 25 Watt. Diese Effizienz zielt auf Edge-Inferenzaufgaben ab, die geringe Latenz erfordern, wie Objekterkennung in autonomen Fahrsystemen oder Echtzeit-Fehlererkennung in der Fertigung. Im Gegensatz zu GPUs von AMD oder Intel, die für das Training großer Modelle entwickelt wurden, ist das Silizium von Untether AI für feste Inferenzfunktionen optimiert und nutzt Techniken wie Modell-Pruning und Quantisierung, um den Durchsatz zu maximieren.
Software-Stack und Kompatibilität
Das Unternehmen bietet ein Software-Entwicklungskit namens untether SDK an, das Modelle aus TensorFlow- und PyTorch-Frameworks in ausführbare Binärdateien für seine Hardware kompiliert. Die Toolchain unterstützt Schichten, die im Deep Learning üblich sind, einschließlich Faltung, Pooling und Residualnetzwerke, und enthält einen Simulator zur Leistungsschätzung. Im Jahr 2023 kündigte Untether AI Unterstützung für ONNX-Export an, was die Integration in bestehende Machine-Learning-Pipelines vereinfacht.
Ein bemerkenswertes Merkmal ist die Unterstützung für sparsity-bewusste Berechnung, bei der der Compiler Nullwerte in Tensoren erkennt und deren Verarbeitung überspringt, was sowohl Geschwindigkeit als auch Energieeffizienz verbessert. Für Edge-Trainingsszenarien bietet das Unternehmen außerdem einen Modus mit begrenzter Präzision an, der das Feintuning von Modellen auf dem Gerät ermöglicht, obwohl dies ein Forschungsmerkmal bleibt.
Marktposition und Wettbewerb
Untether AI konkurriert in der Nische der Edge-AI-Inferenzbeschleuniger, einem Markt, der auch von Unternehmen wie Groq, das einen ähnlichen On-Chip-Speicheransatz verwendet, aber auf größere Rechenzentrums-Workloads abzielt, und SambaNova, das sich auf rekonfigurierbare Architekturen konzentriert, bedient wird. Im Gegensatz zu AWS Trainium und Google Cloud TPUs, die auf Hyperscale-Rechenzentren skaliert werden, betont Untether AI geringere Leistungsbudgets für dezentrale Bereitstellung. Das Unternehmen positioniert sich als Ergänzung zu Arm-basierten CPUs in eingebetteten Systemen.
Im Jahr 2023 ging Untether AI eine Partnerschaft mit Samsung Electronics ein, um Verpackungslösungen für Chiplets zu entwickeln, was die Kosten für die Massenproduktion potenziell senken könnte. Analysten stellen fest, dass die Abhängigkeit des Unternehmens vom 7-nm-Prozess von TSMC ein wettbewerbsfähiges Leistungs-pro-Watt-Verhältnis bietet, obwohl es Konkurrenz durch die Cloud-AI-Inferenzchips von Qualcomm und kommende Prozessoren von Broadcom gibt.
Anwendungen und Anwendungsfälle
Die primären Zielanwendungen für die Hardware von Untether AI umfassen autonome Fahrzeuge, wo die geringe Latenz eine schnelle Interpretation von Sensordaten ermöglicht, sowie Robotik, wie die humanoiden Systeme, die von Figure AI entwickelt werden. In der Fertigung werden die Chips für visuelle Inspektionssysteme verwendet, die eine Echtzeit-Anomalieerkennung erfordern. Das Unternehmen zielt auch auf medizinische Bildgebung ab, insbesondere auf chirurgische Roboter, die schnelle Bildverarbeitung benötigen, sowie auf Fernerkundung mit Satellitendaten.
Im Rechenzentrum bietet Untether AI Beschleunigungskarten für AWS-Instanzen und On-Premise-Server an, mit Fokus auf Inferenz für große Sprachmodelle mit reduziertem Stromverbrauch pro Anfrage. Bereitstellungskits, die 2024 eingeführt wurden, enthalten vortrainierte Modelle für häufige Aufgaben wie Sentimentanalyse und Objektverfolgung, wobei Frameworks wie OpenAIs GPT-2 als Referenz verwendet werden.
Leistung und Benchmarks
Unabhängige Benchmarks, die Ende 2023 von der MLPerf-Organisation veröffentlicht wurden, zeigten, dass der speedAI240 von Untether AI 75 Bilder pro Sekunde bei der ResNet-50-Klassifikationsaufgabe mit 8-Bit-Präzision und 0,5 Joule pro Bild erreicht, was die Energieeffizienz von Nvidias Jetson Orin um den Faktor drei übertrifft. Bei größeren Modellen wie BERT zeigt die sequenzielle Speicherarchitektur jedoch einen langsameren Durchsatz aufgrund der begrenzten On-Chip-Kapazität. Das Unternehmen adressiert dies durch Unterstützung von Off-Chip-LPDDR5-Speicher, der bis zu 64 GB konfigurierbar ist, und überbrückt damit Edge- und Server-Workloads.
Im Vergleich zu Intels Movidius-Chips bietet der speedAI240 eine höhere Spitzen-TOPS-Leistung, jedoch zu höheren Kosten, was ihn für Premium-Anwendungen wie autonome Lastwagen geeignet macht. Eine Studie von 2024 am MIT Computer Science and Artificial Intelligence Laboratory nannte das Design von Untether AI als führendes Beispiel für Near-Memory-Computing in Industrieprodukten.
Roadmap und zukünftige Richtungen
Derzeit entwickelt Untether AI seine zweite Generation, Codename „Gemini“, die 16-Bit-Gleitkommaformate für aufkommende transformerbasierte Modelle unterstützen soll. Das Unternehmen plant, den Chip Ende 2025 zu bemustern, mit einem Ziel von 10 TOPS/W Effizienz, was die aktuellen Zahlen verdreifachen würde. Ein Schwerpunkt liegt auf der Verbesserung der Toolchain, um Transformatoren und Multi-Head-Attention effizient auf Edge-Geräten zu verarbeiten.
Das Unternehmen erforscht auch die Integration seiner Beschleuniger mit RISC-V-Kernen, um vollständig programmierbare SoCs zu ermöglichen und die Abhängigkeit von externen Steuerprozessoren zu reduzieren. Im Jahr 2024 kündigte es eine Forschungskooperation mit dem Berkeley AI Research-Labor zu energiebewusster Planung für verteilte Inferenz an. Langfristig strebt Untether AI an, ein Schlüsselakteur im generativen KI-Edge-Markt zu werden, mit Prognosen von 1 Million ausgelieferten Einheiten bis 2027.
Führung und Unternehmensführung
CEO Arun Subramaniyan leitet ein Managementteam, das Chief Technology Officer Martino Andreani und VP of Engineering Tom Doyle umfasst. Der Vorstand umfasst Venture-Partner von Radical Ventures und Samsung Research, die strategische Beratung bieten. Das Unternehmen beschäftigt Anfang 2025 insgesamt 180 Mitarbeiter in Toronto, Ottawa und San Jose. Zu den bemerkenswerten Beratern gehören Anima Anandkumar, eine prominente Persönlichkeit auf dem Gebiet der Tensormethoden, und Geoffrey Hinton, der während der Gründung informell als Berater fungierte.
Die Patente von Untether AI, über 40 erteilte Anmeldungen, decken Misfit-Speicher- und dynamische Spannungsskalierungstechniken ab, und das Unternehmen hat ein Portfolio von der University of Toronto lizenziert. Die finanzielle Position des Unternehmens blieb während des Abschwungs 2024 stabil, mit einer Serie-C-Finanzierung von 100 Millionen US-Dollar, die im Januar 2025 unter der Leitung von PSP Investments angekündigt wurde.
Brancheneinfluss und Rezeption
Branchenbeobachter betrachten Untether AI als Pionier bei der kommerziellen Skalierung der Forschung zum At-Memory-Computing, wobei das Stanford AI Lab eine Fallstudie zu seinen Designentscheidungen hostet. Partnerschaften mit Ökosystemakteuren wie Arm und TomTom für Navigationssysteme haben die Reichweite erweitert. Einige in der Machine-Learning-Community stellen jedoch die langfristige Lebensfähigkeit von Edge-spezifischen Chips in Frage, da Cloud-Anbieter günstigere Inferenz über Oracle Cloud- und Azure-Dienste anbieten. Untether AI kontert mit Hinweis auf latenzkritische und datenschutzsensible Anwendungen, bei denen Daten das Gerät nicht verlassen dürfen.
Das Unternehmen hat auch zu Open-Source-Software beigetragen und ein Compiler-Backend veröffentlicht, das 2024 in die ONNX-Runtime-Community übernommen wurde, obwohl die weitere Integration noch läuft. Seine Finanzierungstrajektorie spiegelt anhaltendes Investoreninteresse an spezialisiertem KI-Silizium wider, das inmitten einer breiteren Marktkonsolidierung im Sektor entstanden ist.