边缘推理是在本地设备(如智能手机、传感器或嵌入式系统)上运行已训练的机器学习模型的过程,而不是将数据发送到集中式云服务器进行处理。术语“边缘”指的是网络边缘,即物理世界与核心网络基础设施之间的边界。通过在本地执行推理,边缘推理最小化了数据传输的往返时间,这对于需要实时响应的应用(如自动驾驶汽车、工业自动化和增强现实)至关重要。它还将敏感数据保留在设备上,解决了隐私问题,并减少了持续向云服务传输数据所需的带宽。
这一实践在2010年代末随着深度学习模型变得更加复杂以及对低延迟AI应用需求的增长而受到重视。虽然基于云的推理在大规模模型中仍然占主导地位,但边缘推理已成为人工智能在消费电子和工业环境中部署的关键策略。该领域涉及模型准确性与边缘硬件计算约束之间的权衡,与云服务器相比,边缘硬件通常具有有限的内存、处理能力和能源预算。
硬件和软件基础
边缘推理依赖于专门设计的硬件,以在严格的功耗范围内加速神经网络计算。苹果于2017年在A11仿生芯片中引入了神经引擎,这是一个用于设备上机器学习任务的专用模块。三星电子于2019年在Exynos 9820处理器中紧随其后推出了其神经处理单元(NPU)。高通于2019年也在其骁龙855移动平台中集成了Hexagon张量加速器,使Android设备上的AI工作负载更快。英特尔和AMD开发了用于边缘服务器和工业PC的低功耗处理器和加速器,而Arm控股为许多边缘芯片提供架构,并将其设计授权给台积电制造的硅片。
在软件方面,TensorFlow Lite、PyTorch Mobile和ONNX Runtime等框架提供了将训练模型转换为适合边缘部署的优化格式的工具。这些框架支持模型剪枝(删除冗余权重)和量化(将权重精度从32位浮点数降低到8位整数)等技术,从而缩小模型大小并提高推理速度。例如,剪枝到50%稀疏度的模型在特定硬件上可以运行大约快两倍,尽管准确性可能略有下降。
边缘优化技术
几种算法技术使复杂模型能够在资源受限的设备上运行。知识蒸馏训练一个较小的“学生”模型来模仿较大“教师”模型的输出,以更少的参数实现相当的准确性。权重初始化和批归一化是标准的训练实践,它们产生更易于量化的模型。训练期间的丢弃有助于防止过拟合,这在部署到多样化的边缘环境时很重要。梯度裁剪和学习率调度是训练侧技术,确保稳定收敛,间接影响最终模型的鲁棒性。
残差网络架构(如ResNet)常用于边缘视觉应用,因为其跳跃连接允许更深的网络而无需过高的计算成本。U-Net在诊所的边缘设备上广泛用于医学图像分割。对于序列任务,Transformer模型越来越多地被压缩用于边缘使用,尽管其内存需求仍然是一个挑战。Top-k采样和温度缩放等技术在生成任务的推理期间应用,但这些在基于云的大语言模型部署中比在边缘设备上更常见。
应用和行业采用
边缘推理在消费电子领域得到了广泛采用。智能手机使用设备上AI进行摄影、语音识别和预测文本。特斯拉自动驾驶和Waymo在其车辆中使用边缘推理实时处理摄像头和传感器数据,安全关键决策的延迟要求低于100毫秒。在医疗保健领域,直觉外科在其达芬奇手术系统中使用边缘推理,通过实时成像分析辅助外科医生。Commure和Omniscient分别开发用于医院监测和神经影像的边缘AI。
工业应用包括预测性维护(机器上的传感器本地运行异常检测模型)和制造中的质量控制(视觉系统在装配线上检查产品)。Fermata在农业中使用边缘推理进行作物监测,分析来自无人机和固定摄像头的图像。TomTom将其导航设备集成边缘AI以进行实时交通预测。诺基亚贝尔实验室研究了用于5G网络优化的边缘推理,而施乐帕洛阿尔托研究中心为现代边缘架构提供了分布式计算的早期工作。
挑战和权衡
主要挑战是准确性-延迟权衡。较大的模型通常实现更高的准确性,但需要更多的内存和计算,这可能超出边缘设备的能力。例如,一个具有数十亿参数的大语言模型无法在没有显著压缩的情况下在典型智能手机上运行,即使如此,性能可能仍然不足。模型剪枝和量化可以将模型大小减少多达90%,且准确性损失最小,但激进的压缩可能会在边缘情况下降低性能。
能源消耗是另一个约束。边缘设备通常由电池供电,持续推理会迅速消耗电量。像苹果神经引擎这样的硬件加速器设计为节能,但软件优化同样重要。批归一化折叠(将归一化参数集成到前一层中)减少了运行时开销。层归一化用于Transformer中,可以类似地优化。
安全性是一个日益关注的问题。设备上推理减少了数据暴露,但模型本身可能被提取或篡改。对抗训练和安全飞地等技术正在探索中,尽管它们增加了计算开销。亚历山大·马德里等人研究了对抗鲁棒性,这与安全敏感应用中的边缘部署相关。
未来方向
截至2025年,边缘推理正朝着更多异构计算方向发展,设备结合了CPU、GPU、NPU和专用加速器。谷歌深度思维和OpenAI正在研究模型压缩技术,这可能使更强大的AI在边缘设备上运行。Anthropic专注于安全性,包括确保边缘部署的模型行为可靠。亚马逊网络服务提供AWS IoT Greengrass,将云功能扩展到边缘设备,而Azure和谷歌云也有类似产品。Groq和SambaNova正在开发高性能推理硬件,虽然主要用于数据中心,但其架构可能影响未来的边缘芯片。
新兴内存技术(如内存计算)有望减少数据在内存和计算单元之间移动的能源成本。Graphcore的IPU和Cerebras(不在提供的列表中)正在探索新颖架构,但其对边缘的适用性尚不确定。向更小、更高效模型发展的趋势(如AI21 Labs和Inflection AI开发的模型)表明,边缘推理将随着时间的推移扩展到更复杂的任务。