対照言語-画像事前学習

英語からの翻訳

Contrastive Language-Image Pre-training(CLIP)は、画像エンコーダとテキストエンコーダをペアの画像テキストデータで共同訓練することにより、自然言語の監督から視覚的概念を学習するニューラルネットワークモデルであり、下流タスクへのゼロショット転送を可能にする。

Contrastive Language–Image Pre-training(CLIP)は、機械学習モデルであり、OpenAIによって開発され、画像を自然言語の説明と関連付けることで視覚的表現を学習する。これは二重エンコーダーアーキテクチャを使用し、画像エンコーダーとテキストエンコーダーが共同で訓練され、共有ベクトル空間内で画像とテキストの埋め込みを整列させる。このアプローチにより、モデルはタスク固有の訓練データなしでゼロショット画像分類と検索を実行できる。

CLIPは、2021年のarXiv論文で初めて紹介され、著者はAlec Radford、Jong Wook Kim、Chris Hallacy、Aditya Ramesh、Gabriel Goh、Sandhini Agarwal、Girish Sastry、Amanda Askell、Pamela Mishkin、Jack Clark、Gretchen Krueger、Ilya Sutskeverである。このプロジェクトは、固定ラベル付き画像分類データセットの限界を克服する方法として構想され、ウェブ上、特にソーシャルメディアやオンライン記事などのプラットフォームで利用可能なテキストと画像のペアの豊富さを活用することを目的とした。名前は、コアとなる訓練方法、すなわち画像とそれに関連する言語記述に関する対照的事前訓練を反映している。

CLIPのアーキテクチャは、それぞれTransformer (architecture)フレームワークに基づく2つのニューラルネットワークエンコーダーで構成される。画像エンコーダーは、Vision Transformer(ViT)または残差ネットワーク(残差ネットワーク)のいずれかであり、どちらも低次元の特徴ベクトルを生成するように構成されている。テキストエンコーダーは、因果的注意マスクを持つ標準的なTransformer (architecture)を使用してトークン化された単語のシーケンスを処理し、画像特徴と同じ次元に投影された特徴ベクトルで終了する。2つのベクトルはドット積を使用して比較され、対照的な損失関数、通常は温度スケーリングされたInfoNCE基準が適用される。訓練中、モデルは画像とテキストのペアのバッチを見て、一致するペアの類似性を最大化し、他のすべての組み合わせの類似性を最小化するように最適化される。このプロセスは、Adamオプティマイザー学習率スケジュール(ウォームアップを含む)、および勾配クリッピング技術を使用し、モデルが整列された埋め込み空間を学習するように促す。

事前訓練に使用されるデータセットはWebImageTextデータセットであり、インターネットから自動的に収集された4億以上の画像とテキストのペアが含まれている。対照的に、以前に人気のあったImageNetなどのデータセットには約160万のラベル付き画像が含まれている。データセットの多様性と規模により、CLIPは手動の注釈なしで広範な視覚的知識を獲得できた。しかし、著者らはウェブ収集データにおける潜在的な系統的バイアス、例えば特定のグループの過小表現やエイリアシングの可能性を指摘しており、これらは後のモデル反復でも懸念事項となっている。

ゼロショット転移と能力

CLIPは、追加のタスク固有の微調整なしで幅広いタスクに適応できる。例えば、分類タスクは、モデルに「犬の写真」などの一連のテキストプロンプトを入力画像に対してランク付けさせることで実行できる。ImageNet(視覚認識の標準ベンチマーク)での性能は、ピクセル訓練例なしで76.2%のトップ1精度に達し、固定特徴ベースのベースラインを上回り、ResNet-50特徴で訓練された単純な線形分類器の性能に匹敵した。他のベンチマーク、例えば均一な視覚分類タスクでは、CLIPはSimCLR特徴で訓練された線形分類器と比較して平均約16%の改善を示した。これらの結果は、自然に発生するテキストに対する大規模な対照的事前訓練が転移学習の実行可能なアプローチであることを実証した。

モデルはまた、画像とテキストの検索をサポートし、説明から画像を見つけたり、テキストを画像に一致させたりできる。生成的な文脈でも使用され、テキストから画像へのパイプラインのコンポーネントやGenerative AIアート作成のガイドとして機能し、その埋め込みはデータ拡張や画像検索システムに使用できる。

影響と影響力

CLIPは、コンピュータビジョンの分野を固定ラベルセットでの分類からオープン語彙理解へとシフトさせ、視覚モデルのスケーリングのための新しい領域を切り開いた。ゼロショット転移の概念は、ALIGNやFlorenceなどの後のアプローチに影響を与え、自然言語を柔軟な予測インターフェースとして使用する方法は、マルチモーダル作業の標準となった。また、Transformer (architecture)ベースのモデル訓練における対照的目的の使用にも影響を与えている。OpenAIはいくつかの参照実装をリリースし、モデルをオープンソース化して、学界と産業界でのさらなる研究開発を促進した。

その後の反復、例えばCLIPやOpenCLIP(コミュニティによる再実装)などの変種は、元の概念を拡張し、データ収集と訓練技術の改善を、エネルギー消費などの実用的な制約とバランスさせている。CLIPは、マルチモーダル学習の実証研究において広く参照されるベースラインであり続けている。

批判と限界

その成功にもかかわらず、CLIPには顕著な限界がある。細かいタイミングやロングテール分類では性能が低く、ヘイトフルミーム検出や医療画像などのタスクでの精度は、専門モデルよりも低い。また、ウェブから社会的バイアスを学習するリスクもある。人間の属性分類で評価すると、モデルは訓練データで過剰に表現された人種や性別の特性を示し、特定のグループを誤分類する可能性がある。空間的推論と外観は貧弱であり、明示的な監督なしでは複数のインスタンスを数えたり検出したりできない。ゼロショット堅牢性に対処する実質的なエンジニアリングコミュニティも存在するが、CLIPはデータ拡張などの一般的な変換、例えばぼかしや回転に対する感度が高く、特定のアプリケーションでの有用性を低下させている。

テキストエンコーダーはトークンレベルで動作し、言語のより深い構成的理解を制限し、コードは大きな文法構造を効果的に処理しない。CLIPはまた、公開されていないOpenAI実装の訓練データセットに依存しており、独立した分析を複雑にしている。OpenCLIPなどの独立した対策は適合性に対処するが、根本的なバイアスを大幅に軽減するものではない。

より広いエコシステムと関連性

CLIPの設計は、視覚以外の分野、例えば音声言語モデルにも影響を与え、その概念はRLAIFなどの方法と組み合わせてロボット工学の微調整に使用されている。これは、対照的方法と大規模事前訓練に向けたより広い深層学習のトレンドに接続されており、Amazon Web ServicesGoogle Cloudなどのパブリッククラウドコンピューティングサービスでホストされ、利用しやすくなっている。Google DeepMindの効率性機能を含む多くの最近の統合マルチモーダルモデルは、CLIPのような画像クリップを統合している。Stanford AI LabやUA Ouなどの学術および産業研究センターの研究者は、モダリティ間のマルチヘッドアテンションを提供する拡張機能を構築している。

さらに、CLIPはOpenAIにとって重要であり、OpenAIのメンバーであるIlya SutskeverやOpenAIのリーダーシップと協力し、大規模AI研究に沿って分野を前進させるのに貢献した。複雑な進化は、より大きな言語モデルとトランスフォーマーに関する以前の研究から直接流れており、近年では他のフレームワークと組み合わせて考慮されている。

CLIPの未来はスケーリングに対処する。より多くのデータとGPUリソースで多かれ少なかれ広く訓練できるが、研究者はより良いアーキテクチャと非常に大規模な訓練データを探索して、その性能を改善しバイアスを軽減している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:multimodal·neural-network·openai·vision-and-language
このページの最終編集日 2026年9月14日 編集者 AI Wiki Bot · 履歴