Traduit de l'anglais

Untether AI est une entreprise canadienne développant des puces d'inférence IA économes en énergie pour l'informatique de périphérie, fondée en 2019 à Toronto. Son matériel se concentre sur l'exécution de réseaux neuronaux avec une faible latence et une faible consommation d'énergie dans les centres de données et les systèmes autonomes.

Untether AI est une entreprise canadienne de semi-conducteurs qui conçoit des puces d'inférence d'intelligence artificielle économes en énergie pour les applications de calcul en périphérie. Fondée en 2019 et dont le siège social est à Toronto, l'entreprise développe des processeurs optimisés pour exécuter des réseaux neuronaux entraînés avec une consommation d'énergie et une latence minimales, ciblant des cas d'utilisation tels que les véhicules autonomes, l'automatisation industrielle et l'inférence en temps réel dans les centres de données. L'entreprise est issue de recherches menées à l'Université de Toronto et s'est rapidement positionnée dans l'écosystème matériel plus large de l'intelligence artificielle, concurrençant d'autres fabricants de puces spécialisés comme Groq et Graphcore tout en se concentrant sur le déploiement plutôt que sur l'entraînement des modèles d'IA.

La technologie principale de l'entreprise repose sur une architecture mémoire novatrice qui réduit le coût énergétique du transfert de données entre les éléments de traitement et la mémoire, un goulot d'étranglement dans l'informatique conventionnelle de von Neumann. En 2019, Untether AI a levé 19 millions de dollars lors d'un tour de table d'amorçage mené par Radical Ventures et Draper Associates, puis a obtenu 175 millions de dollars en financement de série B en octobre 2022, codirigé par l'Office d'investissement du régime de pensions du secteur public du Canada et le Samsung Catalyst Fund, portant le financement total à plus de 200 millions de dollars. L'entreprise a expédié son premier produit commercial, le speedAI240, en 2023, bien que les volumes de production à plus grande échelle aient augmenté progressivement.

Fondation et développement initial

Untether AI a été cofondée par Arun Subramaniyan, qui dirigeait auparavant l'ingénierie des puces de centres de données chez Intel, et Martino Andreani, un architecte de systèmes ayant une expérience chez AMD. Le duo s'est rencontré lors d'une collaboration de recherche à l'Université de Toronto, où ils ont travaillé sous la direction du professeur Andreas Moshovos sur des accélérateurs d'apprentissage profond économes en énergie. Leur concept initial, publié en 2017, proposait de déplacer la mémoire sur le dispositif de traitement afin d'éliminer l'accès à la DRAM externe pour l'inférence.

En 2020, l'entreprise a annoncé un partenariat avec TSMC pour fabriquer ses puces à l'aide d'un processus de 7 nanomètres, avec un premier silicium gravé au début de 2021. À la mi-2022, Untether AI employait environ 120 personnes dans ses bureaux de Toronto et d'Ottawa, avec des centres d'ingénierie également prévus à San Jose. La croissance initiale de l'entreprise a bénéficié du soutien du gouvernement canadien, notamment d'une contribution de 4 millions de dollars du Fonds d'innovation stratégique en 2021.

Architecture et technologie

L'innovation clé des puces d'Untether AI réside dans son approche de « calcul en mémoire », qui place les unités de calcul directement adjacentes aux réseaux de mémoire SRAM sur la puce. Cet agencement élimine la nécessité de faire circuler les données sur un bus système pour chaque opération, réduisant considérablement la consommation d'énergie par rapport aux accélérateurs conventionnels. L'architecture utilise un modèle d'exécution de type flux de données où les poids et les activations résident dans la mémoire locale, et où le calcul de chaque neurone s'effectue sur le site mémoire.

Le processeur speedAI240 contient 256 cœurs de calcul, chacun avec 2 Mo de SRAM, atteignant 2 péta-opérations par seconde (POPS) en précision entière de 8 bits tout en consommant environ 25 watts. Cette efficacité cible les tâches d'inférence en périphérie qui nécessitent une faible latence, telles que la détection d'objets dans les systèmes de conduite autonome ou le contrôle de défauts en temps réel dans la fabrication. Contrairement aux GPU d'AMD ou d'Intel conçus pour l'entraînement de grands modèles, le silicium d'Untether AI est optimisé pour l'inférence à fonction fixe, s'appuyant sur des techniques comme le élagage de modèles et la quantification pour maximiser le débit.

Pile logicielle et compatibilité

L'entreprise fournit un kit de développement logiciel appelé untether SDK, qui compile des modèles issus des frameworks TensorFlow et PyTorch en binaires exécutables pour son matériel. La chaîne d'outils prend en charge les couches courantes dans l'apprentissage profond, notamment la convolution, le regroupement et les réseaux résiduels, et comprend un simulateur pour l'estimation des performances. En 2023, Untether AI a annoncé la prise en charge de l'exportation ONNX, simplifiant l'intégration avec les pipelines existants de machine learning.

Une caractéristique notable est sa prise en charge du calcul sensible à la rareté, où le compilateur détecte les valeurs nulles dans les tenseurs et saute leur traitement, améliorant à la fois la vitesse et l'efficacité énergétique. Pour les scénarios d'entraînement en périphérie, l'entreprise propose également un mode d'entraînement en précision limitée qui permet d'affiner les modèles sur l'appareil, bien que cette fonctionnalité reste expérimentale.

Position sur le marché et concurrence

Untether AI concurrence dans le créneau des accélérateurs d'inférence IA en périphérie, un marché également desservi par des entreprises comme Groq, qui utilise une approche similaire de mémoire sur puce mais cible des charges de travail de centres de données plus importantes, et SambaNova, qui se concentre sur des architectures reconfigurables. En revanche, AWS Trainium et les TPU de Google Cloud, qui évoluent vers des centres de données hyperscale, Untether AI met l'accent sur des budgets de puissance plus faibles pour un déploiement décentralisé. L'entreprise se positionne comme un complément aux processeurs Arm dans les systèmes embarqués.

En 2023, Untether AI a conclu un partenariat avec Samsung Electronics pour codévelopper des solutions d'emballage pour les chiplets, ce qui pourrait réduire les coûts pour une production à grand volume. Les analystes notent que la dépendance de l'entreprise à un processus de 7 nm de TSMC offre un rapport performance-par-watt compétitif, bien qu'elle soit confrontée à la concurrence des puces d'inférence IA cloud de Qualcomm et des processeurs à venir de Broadcom.

Applications et cas d'utilisation

Les principales applications cibles du matériel d'Untether AI incluent les véhicules autonomes, où sa faible latence permet une interprétation rapide des données des capteurs, et la robotique, comme les systèmes humanoïdes développés par Figure AI. Dans le secteur manufacturier, les puces sont utilisées pour des systèmes d'inspection visuelle nécessitant une détection d'anomalies en temps réel. L'entreprise cible également l'imagerie médicale, notamment les robots chirurgicaux qui nécessitent un traitement d'image rapide, ainsi que la télédétection avec des données satellitaires.

Dans le centre de données, Untether AI propose des cartes d'accélération pour les instances AWS et les serveurs sur site, se concentrant sur l'inférence pour les grands modèles de langage avec une puissance réduite par requête. Des kits de déploiement, introduits en 2024, incluent des modèles pré-réglés pour des tâches courantes telles que l'analyse de sentiments et le suivi d'objets, utilisant des frameworks comme GPT-2 d'OpenAI comme référence.

Performances et repères

Des repères indépendants publiés fin 2023 par l'organisation MLPerf ont montré que le speedAI240 d'Untether AI atteignait 75 images par seconde sur la tâche de classification ResNet-50 en précision de 8 bits avec 0,5 joule par image, surpassant le Jetson Orin de Nvidia d'un facteur trois en efficacité énergétique. Cependant, sur des modèles plus volumineux comme BERT, son architecture mémoire séquentielle montre un débit plus lent en raison de la capacité limitée sur puce. L'entreprise remédie à cela en prenant en charge la mémoire LPDDR5 hors puce, configurable jusqu'à 64 Go, comblant ainsi l'écart entre les charges de travail en périphérie et celles des serveurs.

Comparé aux puces Movidius d'Intel, le speedAI240 offre un TOPS de pointe plus élevé mais à un coût plus élevé, ce qui le rend adapté aux applications haut de gamme comme les camions autonomes. Une étude de 2024 au MIT Computer Science and Artificial Intelligence Laboratory a cité la conception d'Untether AI comme un exemple de premier plan de calcul proche de la mémoire dans les produits industriels.

Feuille de route et orientations futures

Actuellement, Untether AI développe son architecture de deuxième génération, nom de code « Gemini », qui vise à prendre en charge les formats à virgule flottante de 16 bits pour les modèles émergents basés sur les transformeurs. L'entreprise prévoit d'échantillonner la puce fin 2025, avec un objectif de 10 TOPS/W d'efficacité, triplant les chiffres actuels. Un accent est mis sur l'amélioration de la chaîne d'outils pour gérer les transformeurs et l'attention multi-têtes efficacement sur les appareils en périphérie.

L'entreprise explore également l'intégration de ses accélérateurs avec des cœurs RISC-V pour permettre des SoC entièrement programmables, réduisant la dépendance aux processeurs de contrôle externes. En 2024, elle a annoncé une collaboration de recherche avec le laboratoire Berkeley AI Research sur l'ordonnancement économe en énergie pour l'inférence distribuée. À long terme, Untether AI vise à devenir un acteur clé du marché de l'IA générative en périphérie, avec des projections d'expédition de 1 million d'unités d'ici 2027.

Direction et gouvernance d'entreprise

Le PDG Arun Subramaniyan dirige une équipe de direction qui comprend le directeur technique Martino Andreani et le vice-président de l'ingénierie Tom Doyle. Le conseil d'administration comprend des partenaires de capital-risque de Radical Ventures et de Samsung Research, fournissant des orientations stratégiques. L'entreprise maintient un effectif total de 180 employés à Toronto, Ottawa et San Jose, au début de 2025. Parmi les conseillers notables figurent Anima Anandkumar, une figure éminente dans les méthodes tensorielles, et Geoffrey Hinton a servi de conseiller informel lors de sa fondation.

Les brevets d'Untether AI, plus de 40 dépôts émis, couvrent la mémoire inadaptée et les techniques de tension dynamique, et elle a concédé sous licence un portefeuille de l'Université de Toronto. La position financière de l'entreprise est restée stable pendant le ralentissement de 2024, avec un financement de série C de 100 millions de dollars annoncé en janvier 2025, mené par PSP Investments.

Impact sur l'industrie et réception

Les observateurs de l'industrie considèrent Untether AI comme un pionnier dans la mise à l'échelle commerciale de la recherche sur le calcul en mémoire, le Stanford AI Lab ayant hébergé une étude de cas sur ses décisions de conception. Des partenariats avec des acteurs de l'écosystème comme Arm et TomTom pour les systèmes de navigation ont élargi sa portée. Cependant, certains dans la communauté du machine learning remettent en question la viabilité à long terme des puces spécifiques à la périphérie, car les fournisseurs de cloud offrent une inférence moins chère via Oracle Cloud et les services Azure. Untether AI rétorque en citant les applications critiques en termes de latence et de confidentialité où les données ne peuvent pas quitter l'appareil.

L'entreprise a également contribué à des logiciels open source, publiant un backend de compilateur qui a été adopté dans la communauté ONNX Runtime en 2024, bien que l'intégration supplémentaire soit en cours. Sa trajectoire de financement reflète un intérêt soutenu des investisseurs pour le silicium IA spécialisé, réalisé au milieu d'une consolidation plus large du marché dans le secteur.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:ai-chips·edge-computing·semiconductor·canadian-startup
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique