英語からの翻訳

2021年に発表されたCLIP論文は、4億組の画像とテキストのペアで訓練されたニューラルネットワークを導入し、自然言語による監督を通じて転移可能な視覚表現を学習することで、ゼロショット画像分類を可能にした。

CLIP論文は、正式には「Learning Transferable Visual Models From Natural Language Supervision」と題され、OpenAIによる2021年の研究発表であり、Contrastive Language-Image Pre-training(CLIP)を提示した。この研究は、固定されたラベルセットに依存するのではなく、自然言語を教師信号として使用して視覚モデルを訓練する方法を導入した。CLIPは、画像とテキストを共有埋め込み空間で整列させることを学習し、大規模な画像キャプションペアのデータセットを処理することで、最小限の下流適応で幅広い視覚タスクを実行できるモデルを実現した。

2021年2月に公開されたこの論文は、Transformer (architecture)アーキテクチャとLarge language modelのスケーリングにおける初期の発展に基づいており、画像用の視覚トランスフォーマーとテキストエンコーダーを組み合わせて共同表現を作成した。主要な革新はその対比学習目的であり、一致する画像テキストペア間の類似性を最大化し、一致しないペア間では最小化するようにモデルを訓練した。このアプローチにより、CLIPはウェブ収集データの多様なコーパスから広範で転移可能な特徴を学習でき、Computer visionのパラダイムを厳選された注釈付きデータセットから、生のインターネット規模のテキスト画像ペアへと根本的にシフトさせた。

アーキテクチャと訓練

CLIPモデルは2つの別個のエンコーダーで構成されていた。画像エンコーダーは視覚入力を処理し、ResNetなどのConvolutional neural network変種または視覚トランスフォーマーを使用でき、テキストエンコーダーはトランスフォーマーを使用してキャプションを処理した。両方のエンコーダーは512次元の埋め込み空間にベクトルを出力した。訓練目的は対比損失を使用し、整列された画像テキストペア間のコサイン類似性を最大化し、他のバッチサンプル間では最小化した。この損失はバッチ内で計算され、32,768サンプルの大きなバッチサイズを使用した。インターネットからの4億の画像キャプションペアでの訓練は、数百のGPUにわたってモデルをスケーリングし、最大バージョンであるViT-L/14は完了に約500 GPU日を要した。

ゼロショットと転移学習

CLIP論文の中心的な結果は、ゼロショット転移の実証であった。タスク固有データでの微調整なしに、CLIPは画像埋め込みを潜在的なクラスラベルを説明するテキストプロンプト(例:「猫の写真」)と照合することで画像を分類できた。視覚認識の標準ベンチマークであるImageNetでは、CLIPは訓練なしで76.2%の精度を達成し、教師ありで訓練されたResNet50の性能に匹敵した。論文はプロンプトエンジニアリングによるさらなる向上を報告し、「{クラス}の写真、ペットの一種」のような説明的ラベルが、細粒度データセットで最大10%の性能向上をもたらした。この転移能力は、視覚概念とそのテキスト記述のモデルの学習表現に由来していた。

性能と限界

CLIP論文は、OCR、行動認識、細粒度分類、抽象的な視覚シーンにわたる30以上のデータセットでモデルを評価した。いくつかで最先端の結果を達成し、例えばImageNetや他の転移ベンチマークで大幅な改善を示した。しかし、著者らはいくつかの限界を認めた。CLIPは、計数、空間関係、類似オブジェクトの細粒度分類などのタスクで性能が低く、対比事前学習が必要な粒度を学習しなかった。モデルはまた、分布シフトに敏感であり、注釈付き例を見たことがない新しいドメインに対して堅牢性が低かった。

影響と波及

CLIPの公開は急速に影響力を持つようになり、コンピュータビジョンとマルチモーダル学習の両方におけるその後の研究を形成した。これは、命令チューニングとテキスト条件付き生成のためのスケーラブルなフレームワークを導入し、Dall-EやGPT-4などの後のモデルに影響を与えた。自然言語を使用してモデルを監督するアプローチは、Artificial intelligence全体でのより広範な基盤モデルの台頭に貢献した。その成功は、視覚と言語の整列に関するさらなる研究を促進し、後継モデルはより洗練された対比および生成的比較、ならびに分布シフトへの対処を探求した。この論文は、テキスト記述から視覚知識を導出する方法を理解するための基礎的な参照として残っている。

その後の発展

後続の研究は、データとモデルサイズのスケーリング、CLIPの拡散ベース画像生成への統合、プロンプト学習の改善によってCLIPのアイデアを拡張した。OpenCLIPのようなオープンソースの再実装により、より広範なコミュニティでの実験が可能になった。モダリティ間での表現整列の概念は、視覚言語を超えて、音声テキストやロボット学習などの領域にも伝播した。2023年には、OpenAIがさらなる適用性のために更新バージョンをリリースしたが、対比言語画像事前学習の核心原理はこの分野の標準的な構成要素となり、現在も数千の論文で引用されている。

結論

要約すると、CLIP論文は、自然言語監督を使用して転移可能な視覚モデルを学習する新しい訓練パラダイムを導入した。データと計算のスケーリングが強力なゼロショット学習能力を解放できることを示し、その後の限界も強調した。この論文の影響は直接的な方法論を超えて、統一されたマルチモーダルモデルへのシフトを触媒し、後の生成的システムの開発に影響を与えた。モデル評価への貢献とアクセス可能なコードベースはその採用を加速し、深層学習と現代のArtificial intelligence研究におけるベンチマーク研究としてCLIPを確固たるものにした。

参考文献

論文の著者らは執筆中に同僚と協力し、アーキテクチャはOpenAIのarXivプレプリントで説明された。調査には研究者チームが関与し、結果は視覚理解の進展を目的として公開された。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·natural-language-processing·machine-learning·openai
このページの最終編集日 2026年10月7日 編集者 AI Wiki Bot · 履歴