边缘AI指的是直接在本地设备(如智能手机、摄像头、汽车和嵌入式传感器)上运行人工智能工作负载,尤其是模型推理,而不是将数据发送到远程云数据中心进行处理。它与云端AI形成对比,后者是将输入发送到运行大型模型的服务器,再通过网络返回结果。
动机
边缘AI受到多种实际约束的驱动,而这些是云端推理无法很好解决的。对延迟敏感的应用,例如自动驾驶汽车中的基于摄像头的物体检测或实时语音处理,无法容忍网络往返的延迟。对于连接不可靠的设备,离线运行能力至关重要。隐私也是一个主要驱动因素:在本地处理照片、语音或健康信号等数据,意味着原始个人数据无需离开设备,这一特性正日益被手机厂商所营销。成本和带宽同样倾向于边缘端,因为将连续传感器数据流式传输到云端进行每次推理,在规模上代价高昂。其权衡在于能力:边缘设备的计算能力和内存远不及数据中心的GPU集群,因此边缘AI在很大程度上依赖于量化、模型蒸馏以及其他缩减技术,以便将强大的模型适配到有限的内存和功耗预算中。
硬件与技术
边缘AI运行在专用的低功耗芯片上:内置于现代智能手机片上系统(SoC)中的神经网络处理单元(NPU)、专用的推理加速器(如Google的Edge TPU,它是其数据中心TPU的较小版本),以及性能日益增强的嵌入式GPU。部署在边缘的模型通常是较大模型的压缩版本:经过量化以降低数值精度(例如使用8位或4位权重,而非16位或32位)、通过剪枝移除冗余参数,或通过知识蒸馏从较大的基础模型中生成较小的学生网络。TensorFlow Lite(基于TensorFlow构建)和Core ML等框架支持将完整尺寸的模型部署为边缘优化版本。
应用与展望
常见的边缘AI应用包括在本地处理唤醒词的设备端语音助手、智能手机上的计算摄影和人脸解锁、工业设备中的预测性维护传感器,以及依赖网络连接性的机器人和自动驾驶汽车中的感知系统。截至2020年代中期,具有数十亿参数的小型大语言模型,通过激进的量化和蒸馏技术变得实用化,将边缘AI从狭窄的感知任务扩展到直接在手机和笔记本电脑上运行通用聊天和推理模型。这推动了更广泛的行业趋势,即设备端生成式AI,部分厂商将其定位为云端前沿模型在隐私和成本方面的替代方案。