ログ損失(交差エントロピー損失とも呼ばれる)は、確率的分類タスクで使用される損失関数です。これは、予測された確率分布と真のラベル分布との間の非類似度を定量化します。機械学習において、ログ損失はトレーニング中に最小化され、モデルの較正と精度を向上させます。この関数は、確信的だが誤った予測に対して高いペナルティを課すため、ニューラルネットワーク分類器や大規模言語モデルなど、確率的出力が必要なタスクで特に効果的です。
数学的には、真のラベル \(y \in \{0,1\}\) と予測確率 \(p \in [0,1]\) を持つ単一の例に対して、ログ損失は \(- [y \log(p) + (1-y) \log(1-p)]\) と定義されます。多クラス問題では、\(- \sum_{c=1}^{C} y_c \log(p_c)\) に一般化されます。ここで \(C\) はクラス数です。この関数はロジスティック回帰に対して凸であり、AdamオプティマイザやSGDの変種などの勾配ベースの最適化手法が大域的最小値に収束することを保証します。
起源と理論的基礎
ログ損失の概念は情報理論、特に1940年代にクロード・シャノンによって導入された交差エントロピーの概念に根ざしています。交差エントロピーは、モデル分布を使用してある分布からのイベントを符号化するために必要な平均ビット数を測定します。統計的学習において、ログ損失の最小化は、確率モデルの下で観測データの尤度を最大化することと等価です。この関連性は、1950年代から1960年代にかけて、バーナード・ウィドローなどの統計学者によって形式化され、初期のパターン認識システムに適用されました。
機械学習の文脈では、ログ損失はロジスティック回帰とその後の深層学習の台頭とともに分類の標準的な損失関数となりました。ニューラルネットワークのトレーニングでの使用は、1980年代から1990年代にかけて、特にバックプロパゲーションアルゴリズムとともに普及しました。今日、ログ損失は現代のAIシステムで使用される多くの損失関数の基本的な構成要素です。
現代のAIにおける応用
ログ損失は、さまざまな領域の教師あり分類タスクで広く使用されています。自然言語処理や大規模言語モデル(OpenAIやGoogle DeepMindによって開発されたものなど)では、ログ損失は事前学習中にシーケンス内の次のトークンを予測するために使用されます。例えば、トランスフォーマーベースのモデルでは、出力層がソフトマックスを適用して語彙全体の確率分布を生成し、トレーニング目的はこれらの予測と実際の次のトークンとの間のログ損失を最小化することです。
コンピュータビジョンでは、ログ損失は画像分類や物体検出に使用されます。例えば、残差ネットワークアーキテクチャは、分類ヘッドにログ損失を採用することがよくあります。さらに、医療画像では、ログ損失でトレーニングされたモデルがスキャンからの疾患診断に役立ち、較正された確率が意思決定に重要です。
従来の分類を超えて、ログ損失はランキングやレコメンデーションシステムでも使用され、クリック率の最適化に役立ちます。強化学習の変種であるRLAIFでは、ログ損失を使用してモデル出力を人間の好みに合わせることができます。
特性と利点
ログ損失には、二乗誤差などの他の損失関数よりも好まれるいくつかの望ましい特性があります。第一に、厳密に適切であり、最適な予測が真のクラス確率であることを意味し、較正されたモデルを促進します。第二に、滑らかな勾配を提供し、勾配降下による効率的な最適化を容易にします。第三に、確信的で誤った予測に大きなペナルティを課すため、安全性が重要なアプリケーションで有益です。
しかし、ログ損失は外れ値に敏感であり、誤ラベル付けされた例に支配される可能性があります。これを軽減するために、簡単な例の重みを下げる焦点損失などの変種が提案されています。実際には、過信を防ぐためにラベルスムージング(リストにない)などの技術が使用されます。
他の損失関数との比較
ログ損失は、サポートベクターマシンで使用されるヒンジ損失とよく比較されます。ヒンジ損失はマージンの最大化に焦点を当てる一方、ログ損失は確率的解釈を提供し、信頼スコアを必要とするタスクにより適しています。回帰タスクでは平均二乗誤差が一般的ですが、問題が分類として枠組みされない限り、ログ損失は直接適用できません。
多クラス設定では、ログ損失はカテゴリカル交差エントロピーと等価です。また、2つの確率分布間の差を測定するカルバック・ライブラー発散とも関連しています。ログ損失の最小化は、真の分布と予測された分布の間のKL発散を最小化することと等価です。
実装と実用的考慮事項
実際には、ログ損失はTensorFlowやPyTorchなどのほとんどの深層学習フレームワークで実装されています。予測確率の合計が1になることを保証するために、ソフトマックス活性化関数と組み合わせられることがよくあります。数値的安定性は、アンダーフローやオーバーフローを避けるためにログサムエクスプトリックを使用して達成されます。
トレーニング中、ログ損失は通常、ミニバッチ勾配降下を使用して最小化されます。学習率スケジュールの選択は収束に大きく影響します。ドロップアウトやバッチ正規化などの正則化技術は、ログ損失を最適化する際の過学習を防ぐためによく使用されます。
二値分類では、ログ損失はベルヌーイ分布の負の対数尤度として解釈できます。多クラスでは、カテゴリカル分布の負の対数尤度です。この確率的基盤により、確率を出力するモデルにとって自然な選択となります。
将来の方向性
AIモデルがより複雑になるにつれて、ログ損失はトレーニング目的の基礎であり続けます。しかし、研究では不確実性をよりよく捉えるか、ノイズの多いラベルに対してより堅牢な代替損失関数が探求されています。例えば、生成AIでは、ログ損失は識別器と生成器のトレーニングに使用されますが、ワッサースタイン損失などの新しい目的も調査されています。
人工知能の安全性の文脈では、モデルが適切に較正されていることを保証することが重要です。ログ損失は較正に直接対処するため、信頼できるAIシステムを開発するための不可欠なツールです。2025年現在、ログ損失は学界と産業界の両方でほとんどの分類タスクのデフォルトの選択肢であり続けています。