対照学習は、機械学習におけるパラダイムであり、モデルがデータサンプルのペアを比較することで表現を学習する手法である。その中核的な目的は、正のペア、すなわち意味的に類似したサンプルや同じインスタンスの拡張版であるサンプル間の距離を最小化し、負のペア、すなわち類似していないサンプル間の距離を最大化することにある。このアプローチは、自己教師あり学習というより広い枠組みに属し、外部から提供されるラベルに頼るのではなく、データ自体から教師信号を生成する。この対照タスクを解くことで、モデルはデータ内の本質的な特徴と関係性を捉え、しばしば画像分類、音声認識、自然言語処理などの下流タスクに良好に転移する表現を獲得する。
対照学習は2010年代半ば以降、特に深層ニューラルネットワークと大規模なラベルなしデータセットの台頭とともに重要性を増してきた。これは、OpenAIのCLIP(Contrastive Language-Image Pre-training)や、さまざまな音声・視覚エンコーダーを含む、いくつかの影響力のあるモデルの基盤となっている。この手法は、コンピュータビジョン、音声処理、大規模言語モデルなどの分野で広く使用されており、手動によるアノテーションなしでモデルが意味のある埋め込みを学習するのに役立っている。
歴史的発展
対照学習のルーツは、ニューラルネットワークと表現学習における初期の研究に遡る。最も初期の例の一つは、2005年にRaia Hadsell、Sumit Chopra、Yann LeCunによって発表された論文で説明されており、1次元の畳み込みニューラルネットワークのペアを使用して2つの画像を処理し、それらの一致度を最大化することで、類似度メトリクスを効果的に学習した。この研究は、後の対照的手法の基礎を築いた。
2010年代には、2010年にMichael GutmannとAapo Hyvärinenによって導入されたノイズ対比推定(NCE)の概念が、ターゲットサンプルをノイズから区別することによって学習するための統計的枠組みを提供した。これは、2018年にAaron van den Oord、Yazhe Li、Oriol Vinyalsによって提案された損失関数であるInfoNCEの開発に直接影響を与え、現代の対照学習の基礎となった。InfoNCEは、NCEの原理に基づき、負のサンプルのセットの中から正のサンプルを特定する損失を最小化することによって、2つのモデルを共同で最適化する。
中核的原則
対照学習は、正のペアを引き寄せ、負のペアを引き離すという原理に基づいて動作する。正のペアは通常、同じ入力サンプルに異なる拡張、例えばクロップ、回転、色のジッター、ノイズ付加などを適用することによって生成される。負のペアは、バッチまたはデータセット内の異なるサンプルから形成される。モデルは、類似したアイテムが近くに、類似していないアイテムが遠くにある埋め込み空間を学習する。
対照学習における損失関数は、正のペア間の距離を最小化し、負のペア間の距離を最大化するように設計されている。一般的な損失関数には、対照損失、トリプレット損失、InfoNCEなどがある。例えば、InfoNCEは、1つの正のサンプルとN-1個の負のサンプルを含むN個のランダムサンプルのセットが与えられたとき、負のサンプルと比較して正のサンプルに高い確率を割り当てるようにモデルを促す損失を最小化する。
主要な手法とアーキテクチャ
いくつかの影響力のある手法が対照学習を形成してきた。2020年にTing ChenらによってGoogleで導入されたSimCLRは、データ拡張、ベースエンコーダー、プロジェクションヘッド、対照損失を用いたシンプルなフレームワークを使用している。これは、強力な拡張と大きなバッチサイズが性能に重要であることを示した。Facebook AI ResearchのKaiming Heらによって開発されたMoCo(Momentum Contrast)は、バッチ間の一貫性を維持するために、モメンタム更新エンコーダーを備えた動的辞書を導入した。
2021年にOpenAIによって公開されたCLIPは、対照学習をマルチモーダルデータに拡張する。これは、テキストエンコーダーと画像エンコーダーを共同で訓練し、一致する画像とテキストのペアが高いコサイン類似度(埋め込みベクトル間の角度が小さい)を持ち、不一致のペアが低い類似度を持つようにする。これにより、さまざまな視覚タスクへのゼロショット転移が可能になる。
音声処理では、対照学習が音声認識に適用されており、モデルは生の波形またはスペクトログラムから表現を学習する。例えば、Facebook(現在のMeta)は、ラベルなしデータを用いた自己教師あり対照的手法を音声認識に使用し、最先端の結果を達成している。
自己教師あり学習における応用
対照学習は自己教師あり学習のサブセットであり、データ内の固有の構造を活用して訓練信号を作成することを目的としている。自己教師あり学習では、モデルは、画像の欠落部分や文の次の単語を予測するなどのプレテキストタスクで、データ自体から生成された擬似ラベルを使用して訓練される。対照学習は、モデルが類似したペアと類似していないペアを区別しなければならない特定のタイプのプレテキストタスクである。
このアプローチは、私たちがしばしば物体や出来事を比較することによって学習する人間の学習方法を密接に模倣している。例えば、子供は多くの例を見て、それらに共通するものと他の動物とを区別するものに気づくことによって鳥を識別することを学ぶ。対照学習はこの直感を形式化する。
擬似ラベルと適応的学習
多くの自己教師ありパイプラインでは、擬似ラベルが重要な役割を果たす。擬似ラベルは、モデルが自身の予測に基づいてラベルなしデータに割り当てる自動生成されたラベルである。これらは半教師あり学習や、データの統計的特性が時間とともに変化するコンセプトドリフトに適応しなければならないシステムで広く使用されている。そのようなシナリオでは、モデルは入力インスタンスが以前に学習した動作から逸脱していることを検出し、分類結果を生成し、その予測クラスを擬似ラベルとしてモデルコンポーネントの更新に使用することができる。これにより、手動アノテーションなしで継続的な適応が可能になる。
対照学習では、擬似ラベルを使用して正と負のペアを選択することができる。例えば、クラスタリングベースの対照的手法では、モデルはサンプルにクラスタ割り当てを行い、同じクラスタ内のサンプルは正として扱われる。これにより、確信度の高い予測のみを使用することで、エラーの伝播リスクが軽減される。
利点と限界
対照学習にはいくつかの利点がある。それは、しばしば高価で希少なラベル付きデータへの依存を減らす。それは、下流タスクに良好に転移する豊かな表現を学習し、しばしば大規模データセットでの教師あり事前学習を上回る。また、CLIPによって実証されているように、マルチモーダル学習をサポートする。
しかし、対照学習には限界もある。それは、拡張と負のサンプルの慎重な選択を必要とし、選択が不適切だと自明な解や性能低下につながる可能性がある。十分な負のサンプルを提供するために大きなバッチサイズが必要になることが多く、計算コストが高くなる可能性がある。さらに、損失関数とハイパーパラメータの選択が結果に大きく影響する。
最近の開発と将来の方向性
最近の研究は、対照学習の効率と堅牢性の向上に焦点を当てている。BYOL(Bootstrap Your Own Latent)やSimSiamのような手法は、負のペアなしで、正のペアとストップグラデーション機構のみを使用して対照学習が機能することを示している。これにより、大きなバッチサイズの必要性が減る。他の研究では、モデルが識別を改善するために困難な負のサンプルに焦点を当てるハードネガティブマイニングを探求している。
生成AIとトランスフォーマーの文脈では、対照学習はモダリティ間の表現を整列させ、テキストと画像の埋め込みを改善するために使用されている。AnthropicやGoogle DeepMindなどの企業は、モデルに対照的目的を組み込んでいる。2025年現在、対照学習はロボティクス、ヘルスケア、自動運転への応用を含む活発な研究分野であり続けている。
結論
対照学習は現代の機械学習における基本的な手法となり、モデルがラベルなしデータから強力な表現を学習することを可能にしている。正のペアを引き寄せ、負のペアを引き離すことによって、データ内の本質的な構造を捉え、多くの領域で最先端の性能につながっている。自己教師あり学習と擬似ラベル付けとの統合は、AIの進歩を推進し続けており、研究者と実践者にとって重要なツールとなっている。