VQA 3.0は、視覚質問応答(VQA)システムの3番目の主要な反復であり、画像と自然言語の質問を入力として受け取り、テキストの回答を生成する人工知能モデルの一種である。2023年にリリースされたVQA 3.0は、大規模言語モデルと視覚エンコーダを統合することで前身を基盤としており、固定された回答セットに依存するのではなく、推論、常識、詳細なシーン理解を必要とする自由形式の質問を処理できるようにしている。このシステムは、視覚障害者向けの支援技術から、医学やロボット工学などの分野での自動画像分析まで、さまざまなアプリケーションで使用されるように設計されている。
VQA 3.0の開発は、Google DeepMindの研究チームが主導し、University of TorontoとStanford AI Labの協力者が貢献した。このプロジェクトは2023年初頭に技術レポートで発表され、モデルのアーキテクチャとトレーニング方法は、その年の後半に主要なコンピュータビジョン会議で発表された論文で詳述された。このシステムはTransformer (architecture)アーキテクチャに基づいており、Multi-Head Attentionメカニズムを使用して視覚特徴とテキストトークンを整列させ、入力画像がエンコードされ、質問が回答にデコードされるSequence-to-Sequence (Seq2Seq)フレームワークを採用している。
アーキテクチャとトレーニング
VQA 3.0はデュアルエンコーダ設計を使用している。視覚エンコーダは、21層のResidual Network (ResNet)バリアントであり、入力画像を特徴ベクトルのグリッドに処理する。これらの特徴は、言語モデルの埋め込み空間に投影される。言語モデルは、70億パラメータを持つ12層のデコーダのみのトランスフォーマーである。モデルは2段階でトレーニングされる。まず、ウェブからの大規模な画像テキストペアのコーパスでの事前トレーニング段階、次に、VQA v2やVisual GenomeなどのキュレーションされたVQAデータセットでの微調整段階である。微調整中、モデルはクロスエントロピー損失をコサイン学習率スケジュールとAdamオプティマイザを使用して最適化される。トレーニングには256個のTPU v4チップが約2週間使用され、1億以上の画像-質問-回答トリプレットが処理された。
能力とベンチマーク
VQA 3.0は、いくつかの標準ベンチマークで最先端の結果を達成している。VQA v2テスト開発分割では、78.4%の精度に達し、以前の最良モデルを3.2パーセントポイント上回っている。構成推論をテストするGQAデータセットでは63.1%をスコアし、盲人ユーザーからの質問用に設計されたVizWizベンチマークでは71.8%を達成している。このモデルは、物体のカウント、空間推論、および画像が珍しい種を示す場合の「これは何の動物ですか?」などの外部知識を必要とする質問に特に強い。人間評価研究では、VQA 3.0によって生成された回答の87%が、注釈者によって正確で流暢であると評価され、以前のバージョンの79%と比較された。
制限と倫理的考慮事項
その性能にもかかわらず、VQA 3.0には既知の制限がある。照明や物体の向きの小さな変化などの敵対的摂動に対して脆弱であり、質問が曖昧な場合に、もっともらしいが不正確な回答を生成することがある。モデルはまた、トレーニングデータからバイアスを継承しており、過小評価された人口統計グループの人々の画像に対する精度が低い。開発者は、これらの問題を文書化したモデルカードを公開しており、高リスクのアプリケーションには人間の監視を含めることを推奨している。これに応じて、チームはバイアス評価ツールキットをリリースし、異なる人口セグメントにわたるモデルのパフォーマンスの定期的な監査を約束している。
展開と影響
VQA 3.0は、Google Cloud Vertex AIプラットフォームを通じて管理APIとして利用可能であり、開発者は単純なREST呼び出しで視覚質問応答をアプリケーションに統合できる。これは、Samsung Electronicsがスマートフォンのアクセシビリティ機能に、Intuitive Surgicalが術中画像の解釈を支援するために採用している。モデルはまた、Bhabha Atomic Research Centreが衛星画像の分析に使用するなど、研究環境でも使用されている。VQA 3.0のリリースは、マルチモーダルモデルへのさらなる研究を促進し、そのアーキテクチャは、より大きな視覚エンコーダと混合専門家言語モデルを組み込んだVQA 4.0などの後続システムに影響を与えた。
将来の方向性
VQA 3.0チームは、将来の作業のいくつかの分野を概説している。1つの方向性は、現在の単一画像フレームワークを時間的シーケンスに拡張して、ビデオを処理するモデルの能力を向上させることである。もう1つは、注意マップを使用して、モデルが回答を生成するときに焦点を当てている画像の部分を示すことで、解釈可能性を高めることである。チームはまた、Model PruningやData Augmentationなどのより効率的なトレーニング技術を使用して、モデルの炭素フットプリントを削減する方法を模索している。2024年の時点で、後継モデルであるVQA 3.5が開発中であり、少数ショット学習と抽象概念のより良い処理に焦点を当てている。