英語からの翻訳

推論とは、学習済みAIモデルを新しい入力に対して実行し出力を生成するプロセスであり、学習とは区別される。そのコスト、レイテンシー、ハードウェア要件は、AI製品が大規模に展開される方法を形作る。

推論(inference)は、人工知能において、訓練済みモデルを新しい入力に対して実行し、出力を生成するプロセスである。これは、モデルのパラメータがデータから学習される初期段階である訓練(training)とは区別される。大規模言語モデルがユーザーの質問に回答すること、画像分類器が写真にラベルを付けること、拡散モデルがテキストプロンプトから画像を生成することは、すべて推論を実行している。訓練が終了し、モデルの重みが固定されると、そのモデルのその後の使用はすべて推論呼び出しとなる。

コストとハードウェア

推論には、訓練とは異なる計算上の要求がある。大規模モデルの訓練では、膨大なデータセットを複数回処理する必要があり、通常はGPUTPUの大規模クラスタ上で数週間から数か月かけて実行される。一方、推論は継続的に実行され、多くの場合、数百万の個別リクエストに応える。そのコスト構造は、単一ジョブが消費する総計算量よりも、単一の応答を生成する時間であるレイテンシと、システムがハードウェア単位あたりに処理できるリクエスト数であるスループットに依存する。言語モデルはテキストを一度に1トークンずつ生成し、各新しいトークンは以前のすべてのトークンに依存するため、自己回帰モデルの推論は比較的遅く、計算量制約ではなくメモリ制約となる。これにより、訓練中心の研究とは異なる、専門的な推論エンジニアリングの波が生まれた。NVIDIAや他のチップメーカーは、推論ワークロードに特化して最適化されたハードウェアをリリースしており、クラウドプロバイダーは推論容量と訓練容量を異なる価格で提供している。

最適化技術

推論コストは使用量に直接比例するため、最適化の主要な対象となる。量子化はモデルの重みの数値精度を下げ、メモリ使用量を削減し、多くの場合、わずかな精度のトレードオフで計算を高速化する。知識蒸留は、より小さなモデルを訓練してより大きなモデルを模倣させ、推論時に実行コストが低いモデルを生成する。投機的デコードは、小さく高速なドラフトモデルを使用して複数のトークンを一度に提案し、より大きなモデルがそれらを並列で検証することで、長い出力を生成する際に必要な遅い逐次ステップの数を減らす。複数のユーザーのリクエストをまとめてバッチ処理すること、アテンションのキー・バリューキャッシュなど、以前に計算された中間結果をキャッシュすること、より単純なクエリをより小さなモデルにルーティングすることは、モデルを大規模に提供するコストを下げるための追加の一般的な技術である。

テスト時計算

推論は伝統的に、訓練と比較して固定された軽量なステップとして扱われてきた。しかし、回答前に拡張された内部推論を生成する推論モデルの台頭により、新しい次元が導入された。推論時に計算をより多く費やすこと、すなわちテスト時計算として知られるアプローチは、難しい問題に対する出力品質を大幅に向上させることができる。これにより、能力に関して訓練時の計算のみが重要であるという従来の前提が曖昧になった。なぜなら、モデルは「より長く考える」ことで、特定の問題に対して推論コストと精度をトレードオフできるようになったからである。このトレードオフは、タスクの難易度に関係なく固定量の出力を生成していた初期世代のモデルには同じ形では存在しなかった。

経済学

広く使用されているAI製品は推論リクエストを継続的に処理するため、デプロイされたモデルの長期的な経済性を支配するのは訓練コストではなく推論コストである。AIインフラストラクチャへの支出に関する業界の議論は、使用量が拡大するにつれて、より大規模なモデルの事前訓練への継続的な投資と並行して、ますます推論容量に焦点を当てている。

カテゴリ:deep-learning·infrastructure·large-language-models
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴