エッジ推論とは、訓練済みの機械学習モデルを、スマートフォン、センサー、組み込みシステムなどのローカルデバイス上で実行するプロセスであり、処理のためにデータを中央のクラウドサーバーに送信するのではなく、ローカルで推論を行うことを指す。「エッジ」という用語はネットワークエッジ、すなわち物理世界とコアネットワークインフラストラクチャの境界を指す。推論をローカルで実行することで、エッジ推論はデータ伝送の往復時間を最小化し、これは自動運転車、産業オートメーション、拡張現実など、リアルタイム応答を必要とするアプリケーションにとって重要である。また、機密データをデバイス上に保持することでプライバシー問題に対処し、クラウドサービスへの継続的なデータストリーミングに必要な帯域幅を削減する。
この実践は、深層学習モデルがより複雑になり、低遅延AIアプリケーションへの需要が高まった2010年代後半に顕著になった。クラウドベースの推論は大規模モデルでは依然として主流であるが、エッジ推論は消費者向け電子機器や産業環境における人工知能展開の主要戦略となっている。この分野は、モデルの精度とエッジハードウェアの計算制約との間のトレードオフを伴い、エッジハードウェアは通常、クラウドサーバーと比較してメモリ、処理能力、エネルギー予算が限られている。
ハードウェアとソフトウェアの基盤
エッジ推論は、厳しい電力制約内でニューラルネットワーク計算を高速化するように設計された専用ハードウェアに依存している。Appleは2017年にA11 BionicチップにNeural Engineを導入し、オンデバイスの機械学習タスク専用ブロックを提供した。Samsung Electronicsは2019年にExynos 9820プロセッサでNeural Processing Unit(NPU)を続けて導入した。Qualcommは同じく2019年にSnapdragon 855モバイルプラットフォームにHexagon Tensor Acceleratorを統合し、AndroidデバイスでのAIワークロードを高速化した。IntelとAMDはエッジサーバーや産業用PC向けの低消費電力プロセッサとアクセラレータを開発しており、Arm Holdingsは多くのエッジチップにアーキテクチャを提供し、TSMC製造のシリコンへの設計ライセンスを供与している。
ソフトウェア面では、TensorFlow Lite、PyTorch Mobile、ONNX Runtimeなどのフレームワークが、訓練済みモデルをエッジ展開用の最適化形式に変換するツールを提供している。これらのフレームワークは、冗長な重みを除去するモデルプルーニングや、重みの精度を32ビット浮動小数点から8ビット整数に削減してモデルサイズを縮小し推論速度を向上させる量子化などの技術をサポートしている。例えば、50%のスパース性にプルーニングされたモデルは、特定のハードウェア上で約2倍高速に実行できるが、精度はわずかに低下する可能性がある。
エッジ最適化のための技術
いくつかのアルゴリズム技術により、リソース制約のあるデバイス上で複雑なモデルを実行できる。知識蒸留は、より小さな「生徒」モデルを訓練して、より大きな「教師」モデルの出力を模倣させ、より少ないパラメータで同等の精度を達成する。重み初期化とバッチ正規化は、量子化に適したモデルを生成する標準的な訓練手法である。訓練中のドロップアウトは過学習を防ぐのに役立ち、多様なエッジ環境への展開時に重要である。勾配クリッピングと学習率スケジュールは、安定した収束を保証する訓練側の技術であり、最終モデルの堅牢性に間接的に影響を与える。
残差ネットワークアーキテクチャ(ResNetなど)は、スキップ接続により過剰な計算コストなしでより深いネットワークを可能にするため、エッジビジョンアプリケーションで一般的に使用されている。U-Netは、クリニックのエッジデバイスでの医用画像セグメンテーションに人気がある。シーケンスタスクでは、トランスフォーマーモデルがエッジ使用向けにますます圧縮されているが、そのメモリ要件は依然として課題である。トップkサンプリングや温度スケーリングなどの技術は生成タスクの推論中に適用されるが、これらはエッジデバイスよりもクラウドベースの大規模言語モデル展開でより一般的である。
アプリケーションと産業界の採用
エッジ推論は消費者向け電子機器で広く採用されている。スマートフォンは写真、音声認識、予測テキスト入力にオンデバイスAIを使用している。Tesla AutopilotとWaymoは、車両でエッジ推論を採用してカメラとセンサーデータをリアルタイムで処理し、安全上重要な決定には100ミリ秒未満の遅延要件がある。医療分野では、Intuitive Surgicalがda Vinci手術システムでエッジ推論を使用して、外科医にリアルタイム画像解析を支援している。CommureとOmniscientは、それぞれ病院モニタリングと神経画像診断用のエッジAIを開発している。
産業用途には、機械のセンサーが異常検出モデルをローカルで実行する予知保全や、製造における品質管理(組立ラインで製品を検査するビジョンシステム)が含まれる。Fermataは農業でエッジ推論を使用して作物を監視し、ドローンや固定カメラからの画像を分析している。TomTomはナビゲーションデバイスにエッジAIを統合してリアルタイム交通予測を行っている。Nokia Bell Labsは5Gネットワーク最適化のためのエッジ推論を研究しており、Xerox PARCは現代のエッジアーキテクチャに影響を与える分散コンピューティングに関する初期の研究に貢献した。
課題とトレードオフ
主要な課題は精度と遅延のトレードオフである。より大きなモデルは一般に高い精度を達成するが、より多くのメモリと計算を必要とし、エッジデバイスの能力を超える可能性がある。例えば、数十億のパラメータを持つ大規模言語モデルは、大幅な圧縮なしでは一般的なスマートフォンで実行できず、圧縮しても性能が不十分な場合がある。モデルプルーニングと量子化は、最小限の精度損失でモデルサイズを最大90%削減できるが、過度な圧縮はエッジケースでの性能を低下させる可能性がある。
エネルギー消費ももう一つの制約である。エッジデバイスはバッテリーで動作することが多く、継続的な推論は電力を急速に消耗する可能性がある。AppleのNeural Engineなどのハードウェアアクセラレータはエネルギー効率が高くなるように設計されているが、ソフトウェアの最適化も同様に重要である。正規化パラメータを前の層に統合するバッチ正規化の折りたたみは、実行時オーバーヘッドを削減する。層正規化はトランスフォーマーで使用され、同様に最適化できる。
セキュリティも増大する懸念事項である。オンデバイス推論はデータ露出を減らすが、モデル自体が抽出または改ざんされる可能性がある。敵対的訓練やセキュアエンクレーブなどの技術が模索されているが、これらは計算オーバーヘッドを追加する。Aleksander Madryらは敵対的堅牢性を研究しており、これはセキュリティ重視のアプリケーションでのエッジ展開に関連する。
将来の方向性
2025年現在、エッジ推論はよりヘテロジニアスなコンピューティングへと移行しており、デバイスはCPU、GPU、NPU、専用アクセラレータを組み合わせている。Google DeepMindとOpenAIは、エッジデバイス上でより強力なAIを可能にするモデル圧縮技術を研究している。Anthropicは安全性に焦点を当てており、エッジ展開モデルが確実に動作することを保証することを含む。Amazon Web ServicesはAWS IoT Greengrassを提供してクラウド機能をエッジデバイスに拡張しており、AzureとGoogle Cloudも同様のサービスを提供している。GroqとSambaNovaは高性能推論ハードウェアを開発しているが、主にデータセンター向けであり、そのアーキテクチャは将来のエッジチップに影響を与える可能性がある。
インメモリコンピューティングなどの新しいメモリ技術は、メモリと計算ユニット間のデータ移動のエネルギーコストを削減することを約束している。GraphcoreのIPUやCerebras(提供リスト外)は新しいアーキテクチャを模索しているが、エッジへの適用性は不確かである。AI21 LabsやInflection AIによって開発されたような、より小型で効率的なモデルへの傾向は、エッジ推論が時間とともにより複雑なタスクに拡大することを示唆している。