コンピュータビジョン

英語からの翻訳

コンピュータビジョンは、機械が画像や動画からの視覚情報を解釈し理解することを可能にするAIの分野であり、分類、検出、セグメンテーション、生成にわたる。

コンピュータビジョンは、人工知能の下位分野であり、機械が画像や動画から意味のある情報を抽出できるようにすることに関係している。これには、物体の認識、シーンの理解、動きの追跡、そして生成的応用における新しい視覚コンテンツの生成が含まれる。これは機械学習、信号処理、幾何学に基づいており、深層学習研究の最も一貫して生産的なテストベッドの一つとなっている。

歴史

1960年代から2000年代までの初期のコンピュータビジョンは、研究者が設計した手作業による特徴量、エッジ検出器、幾何学的モデルに依存し、古典的な機械学習分類器と組み合わせられていた。進歩は遅く、実世界の画像に対する性能は限られたままであった。この分野の決定的な転換は、2009年に公開されたImageNetデータセットと、それを中心に構築された年次のILSVRCコンペティションによってもたらされ、研究者に物体認識のための大規模で標準化されたベンチマークを提供した。2012年、GPUで訓練されたAlexNetという畳み込みニューラルネットワークがILSVRCで大差で勝利し、この出来事はしばしば現代の深層学習時代の始まりとして引用され、ImageNet 2012 (AlexNet moment)の項目でさらに議論されている。畳み込みネットワークはその後10年間、この分野を支配した。

主要タスク

古典的なコンピュータビジョンのタスクには、画像にラベルを割り当てる画像分類、画像内の複数の物体を位置特定してラベル付けする物体検出、各ピクセルをカテゴリまたは物体インスタンスごとにラベル付けする意味的およびインスタンス分割、そして姿勢推定が含まれる。動画タスクでは、フレーム間での物体追跡と、時間経過に伴う動作認識が追加される。各タスクは歴史的に専門化されたアーキテクチャを必要としたが、後のトランスフォーマーベースの視覚モデルは、共有バックボーンの下で複数のタスクをますます統合していった。

CNNからトランスフォーマーへ

畳み込みネットワークは2010年代半ばまで支配的なアーキテクチャであり続け、次第に深く効率的な設計へと進化した。2020年頃から、研究者は元々自然言語処理のために開発されたトランスフォーマーアーキテクチャを、画像をパッチのシーケンスとして扱うことで画像に適応させ、これはVision Transformerとして知られるアプローチである。トランスフォーマーベースの視覚モデルは、大規模においてCNNと競合するかそれ以上の性能を示し、テキストとの組み合わせが容易になったことで、画像とキャプションの共有表現を学習するCLIPなどの視覚言語モデルの台頭に貢献した。

生成的およびマルチモーダルビジョン

2020年代初頭以降、コンピュータビジョンは生成的モデリングとますます重なっている。生成的敵対ネットワークとその後の拡散モデルにより、画像を解釈するだけでなく生成することも可能になり、テキストから画像およびテキストから動画のシステムを支えている。汎用システムに組み込まれた視覚言語モデルは、コンピュータビジョンを狭い認識タスクから、オープンエンドな視覚的質問応答や、マルチモーダルAIの一部としての画像に関する推論へと拡張した。

応用と懸念

コンピュータビジョンは、顔認識、医用画像解析、自動運転車の知覚、産業品質検査、コンテンツモデレーションなど、多くの用途の基盤となっている。その展開は、特に顔認識における人口統計グループ間の精度格差が文書化されているアルゴリズムバイアスや、市民的自由への懸念を引き起こす監視用途について、精査の対象となっており、技術の許容可能な使用に関するより広い議論に影響を与えている。

カテゴリ:computer-vision·deep-learning
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴