CLIP(Contrastive Language–Image Pre-training)は、画像とテキストの関連性を学習するためのモデルであり、OpenAIによって開発された。このモデルは、画像とテキストのペアを大量に用いて、視覚と言語の表現を共通の埋め込み空間にマッピングすることを目的としている。CLIPは、ゼロショット学習や転移学習において高い性能を発揮し、画像分類や検索、生成モデルのガイド

英語からの翻訳

対照言語-画像事前学習(Contrastive Language-Image Pre-training)は、2021年1月にOpenAIが公開したニューラルネットワークであり、画像とテキストの共同表現を学習する。これは、その後の多くのテキストから画像への生成システムの基盤的構成要素となった。

CLIP(Contrastive Language-Image Pre-training)は、視覚言語モデルであり、OpenAIによって2021年1月に公開された。固定されたラベル集合に画像を分類するように訓練されるのではなく、CLIPは、インターネットから収集された画像とキャプションのペアの大規模なデータセット(約4億ペアと報告されている)で訓練することにより、画像と自由形式のテキスト記述を関連付けることを学習する。

手法

CLIPは、共同で訓練される2つのエンコーダ、すなわち画像エンコーダとテキストエンコーダで構成され、それぞれが入力データを共有の埋め込み空間にマッピングする。訓練では対照的な目的関数を使用する。つまり、画像とキャプションのペアのバッチが与えられたとき、モデルは一致する画像とキャプションの埋め込みをその空間内で近づけ、一致しないペアを遠ざけるように訓練される。このアプローチは、初期の対照的表現学習のアイデアに基づいており、CLIPが手動でラベル付けされた分類データセット(ImageNetなど)を必要とせずに、ウェブテキストや代替テキストに存在する自然言語の監督から直接、汎用的な視覚概念を学習できるようにした。

結果として得られたモデルは、画像の埋め込みを候補となるテキストラベルの埋め込みと比較することで、「ゼロショット」画像分類(ゼロショット学習の一形態)を実行でき、それらのカテゴリで明示的に訓練されたことがなくても機能した。これは、過去10年間の主流であった畳み込みネットワークベースの画像分類器(通常、タスク固有の微調整が必要)からの顕著な逸脱であった。

画像生成における役割

CLIPの最も重要な影響は、分類ではなく、生成画像モデルへのガイダンス信号としての使用からもたらされた。公開直後、独立した研究者や愛好家は、CLIPを既存の画像生成技術(初期のGANベースの手法や、後の拡散モデルを含む)と組み合わせ、CLIPのテキストと画像の類似性スコアを使用して、特定のプロンプトに一致する画像に向けて生成を誘導した。この「CLIPガイド」アプローチは、専用システムが登場する前の初期のオープンなテキストから画像へのアートコミュニティの基盤となった。

CLIPのテキストエンコーダは、その後、主要なテキストから画像システムに直接組み込まれ、特にStable Diffusionの条件付けコンポーネントとして使用された。また、その基盤となるアーキテクチャと訓練手法は、DALL-Eのバージョンや後続の視覚言語システムを含む、業界全体の他のマルチモーダルモデルに影響を与えた。CLIPの埋め込みは画像とテキストの間の意味的類似性を捉えるため、このモデルはコンテンツベースの画像検索、画像コレクションの意味検索、および生成画像がプロンプトにどの程度一致するかを評価する自動メトリクスとしても使用されている。

重要性と限界

CLIPは、厳選されたラベルに依存するのではなく、ノイズの多いウェブ規模のデータで対照的事前学習をスケーリングする初期の影響力のある例として頻繁に引用され、その戦略は後にマルチモーダルAI研究全体で繰り返された。また、インターネットの訓練データから継承されたバイアスの事例としても研究されており、研究者は、ウェブからスクレイピングされたキャプションに存在するバイアスを反映して、人種、性別、その他の社会的カテゴリに沿った歪んだ関連付けを記録している。OpenAIはCLIPの重みを公開しており、これは同社の後のほとんどがクローズドなリリースとは対照的であり、オープンソースの生成AIエコシステム全体で広く再利用される構成要素となるのに役立った。

カテゴリ:computer-vision·multimodal-ai·openai-models
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴