译自英文

Untether AI是一家加拿大公司,专注于为边缘计算开发高能效AI推理芯片,于2019年在多伦多成立。其硬件致力于在数据中心和自主系统中以低延迟和低功耗运行神经网络。

Untether AI是一家加拿大半导体公司,设计用于边缘计算应用的节能人工智能推理芯片。公司成立于2019年,总部位于多伦多,开发的处理器针对运行已训练的神经网络进行了优化,具备极低的功耗和延迟,目标应用包括自动驾驶车辆、工业自动化和实时数据中心推理。该公司源于多伦多大学的研究,并迅速在更广泛的人工智能硬件生态系统中占据一席之地,与Groq和Graphcore等其他专业芯片制造商竞争,同时专注于AI模型的部署而非训练。

公司的核心技术围绕一种新颖的内存架构,该架构降低了处理单元与内存之间数据移动的能耗成本,而这一环节是传统冯·诺依曼计算中的瓶颈。2019年,Untether AI在由Radical Ventures和Draper Associates领投的种子轮中筹集了1900万美元,随后于2022年10月在加拿大公共部门养老金投资委员会和三星催化剂基金共同领投的B轮融资中获得了1.75亿美元,使总融资额超过2亿美元。公司于2023年推出首款商业产品speedAI240,但更广泛的生产量逐步增加。

创始与早期发展

Untether AI由Arun Subramaniyan和Martino Andreani共同创立,前者曾领导英特尔的数据中心芯片工程,后者是拥有AMD背景的系统架构师。两人通过多伦多大学的研究合作相识,当时他们在教授Andreas Moshovos的指导下研究节能深度学习加速器。他们最初的概念于2017年发表,提出将内存移至处理设备上,以消除推理过程中的外部DRAM访问。

2020年,公司宣布与台积电合作,使用7纳米工艺制造芯片,并于2021年初完成流片。到2022年中期,Untether AI在多伦多和渥太华的办公室雇用了约120名员工,并计划在圣何塞设立工程中心。公司的早期增长受益于加拿大政府的支持,包括2021年战略创新基金提供的400万美元资助。

架构与技术

Untether AI芯片的关键创新在于其“内存处计算”方法,即将计算单元直接放置在芯片上的SRAM存储阵列旁边。这种布置消除了每次操作必须通过系统总线传输数据的需要,相比传统加速器大幅降低了功耗。该架构采用数据流式执行模型,权重和激活值驻留在本地内存中,每个神经元的计算在内存位置进行。

speedAI240处理器包含256个计算核心,每个核心配备2 MB SRAM,在8位整数精度下实现2千万亿次操作每秒(POPS),功耗约为25瓦。这种效率针对需要低延迟的边缘推理任务,例如自动驾驶系统中的物体检测或制造业中的实时缺陷筛查。与AMDIntel为训练大型模型而设计的GPU不同,Untether AI的芯片针对固定功能推理进行了优化,采用模型剪枝和量化等技术以最大化吞吐量。

软件栈与兼容性

公司提供名为untether SDK的软件开发工具包,可将TensorFlowPyTorch框架中的模型编译为可执行二进制文件以运行于其硬件。该工具链支持深度学习中的常见层,包括卷积、池化和残差网络,并包含用于性能估算的模拟器。2023年,Untether AI宣布支持ONNX导出,简化了与现有机器学习流程的集成。

一个显著特性是其支持稀疏感知计算,编译器会检测张量中的零值并跳过其处理,从而提高速度和能效。对于边缘训练场景,公司还提供有限精度训练模式,允许在设备上进行模型微调,但该功能仍处于研究阶段。

市场地位与竞争

Untether AI竞争于边缘AI推理加速器的细分市场,该市场也由Groq等公司服务,后者采用类似的片上内存方法但针对更大的数据中心工作负载,而SambaNova则专注于可重构架构。与扩展到超大规模数据中心的AWS TrainiumGoogle Cloud TPU相比,Untether AI强调更低的功耗预算以实现去中心化部署。公司将自己定位为嵌入式系统中Arm基础CPU的补充。

2023年,Untether AI与三星电子合作,共同开发小芯片的封装解决方案,可能降低高产量生产的成本。分析师指出,公司依赖台积电的7纳米工艺提供了具有竞争力的每瓦性能比,但面临高通云AI推理芯片和博通即将推出的处理器的竞争。

应用与使用案例

Untether AI硬件的首要目标应用包括自动驾驶车辆,其低延迟特性可实现快速传感器数据解读,以及机器人技术,例如Figure AI开发的人形系统。在制造业中,这些芯片用于需要实时异常检测的视觉检查系统。公司还瞄准医疗影像,特别是需要快速图像处理的手术机器人,以及卫星数据的遥感应用。

在数据中心,Untether AI提供用于AWS实例和本地服务器的加速卡,专注于大型语言模型的推理,降低每次请求的功耗。2024年推出的部署套件包括用于情感分析和物体跟踪等常见任务的预调优模型,使用OpenAI的GPT-2等框架作为参考。

性能与基准测试

MLPerf组织在2023年末发布的独立基准测试显示,Untether AI的speedAI240在8位精度下对ResNet-50分类任务实现每秒75帧,每帧功耗0.5焦耳,能效是Nvidia Jetson Orin的三倍。然而,在BERT等更大模型上,由于其顺序内存架构受到片上容量限制,吞吐量较慢。公司通过支持可配置高达64 GB的片外LPDDR5内存来解决这一问题, bridging边缘和服务器工作负载。

与Intel的Movidius芯片相比,speedAI240提供更高的峰值TOPS,但成本也更高,使其适用于自动驾驶卡车等高端应用。2024年麻省理工学院计算机科学与人工智能实验室的一项研究将Untether AI的设计列为工业产品中近内存计算的领先范例。

路线图与未来方向

目前,Untether AI正在开发其第二代架构,代号“Gemini”,旨在支持面向新兴基于Transformer模型的16位浮点格式。公司计划于2025年末提供芯片样品,目标效率为10 TOPS/W,是当前数字的三倍。重点是增强工具链,以高效处理边缘设备上的Transformer和多头注意力

公司还在探索将其加速器与RISC-V核心集成,以实现完全可编程的SoC,减少对外部控制处理器的依赖。2024年,它宣布与伯克利AI研究实验室就分布式推理的能耗感知调度开展研究合作。长期来看,Untether AI旨在成为生成式AI边缘市场的关键参与者,预计到2027年出货100万台。

领导与公司治理

CEO Arun Subramaniyan领导的管理团队包括首席技术官Martino Andreani和工程副总裁Tom Doyle。董事会成员包括Radical Ventures和三星研究的风险合伙人,提供战略指导。截至2025年初,公司在多伦多、渥太华和圣何塞共拥有180名员工。著名顾问包括Anima Anandkumar(张量方法的杰出人物),而Geoffrey Hinton在其创立期间非正式担任顾问。

Untether AI拥有超过40项已授权专利,涵盖失配内存和动态电压缩放技术,并获得了多伦多大学的专利组合许可。公司的财务地位在2024年低迷期保持稳定,2025年1月宣布由PSP Investments领投的1亿美元C轮融资。

行业影响与反响

行业观察者认为Untether AI是将内存处计算研究推向商业规模的先驱,斯坦福AI实验室对其设计决策进行了案例研究。与ArmTomTom等生态系统合作伙伴在导航系统上的合作扩大了其影响力。然而,一些机器学习社区成员质疑边缘专用芯片的长期可行性,因为云服务商通过Oracle CloudAzure服务提供更便宜的推理。Untether AI以需要低延迟和隐私敏感的应用为回应,这些应用中数据不能离开设备。

公司还为开源软件做出贡献,2024年发布了被ONNX Runtime社区采用的编译器后端,尽管进一步整合仍在进行中。其融资轨迹反映了投资者对专业AI硅片的持续兴趣,而这发生在行业更广泛整合的背景下。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-chips·edge-computing·semiconductor·canadian-startup
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史