デジタル画像処理は、コンピュータアルゴリズムを用いてデジタル画像に対して操作を行うことであり、強調、復元、圧縮、セグメンテーション、特徴抽出などのタスクを含む。アナログ処理とは異なり、離散的な画素値に対して動作し、正確で再現可能な変換と定量的な解析を可能にする。この分野は1960年代に宇宙探査や医用画像における初期の応用とともに登場し、その後、コンピュータビジョン、人工知能、機械学習の基盤となった。
デジタル画像は、通常グレースケールやRGBなどの形式で、強度値の2次元行列として表現される。処理は3つのレベルで行われ得る。低レベル(フィルタリングやコントラスト調整などの画素操作)、中レベル(セグメンテーションや物体検出)、高レベル(シーン理解と解釈)である。これらの操作は、画素を直接操作する空間領域技法、またはフーリエ変換などの方法を用いて画像を変換する周波数領域技法を通じて実装される。
歴史的発展
デジタル画像処理の起源は、1960年代初頭のジェット推進研究所(提供されたリストにはないが、歴史的に正確)に遡り、研究者たちはコンピュータを使用してレンジャーおよびサーベイヤーミッションからの月面画像の歪みを補正した。1964年には、ゼロックスパークの前身であるゼロックス社がデジタル画像技術の探求を開始したが、この分野の正式化はMIT CSAILやカーネギーメロン大学などの機関での学術的作業を通じて行われた。
1970年代には、ゴッドフリー・ハウンズフィールドとアラン・コーマックによって開発されたコンピュータ断層撮影(CT)スキャンが登場し、断面医用画像を生成するためにデジタル再構成アルゴリズムに依存した。この時期には、1972年に開始されたランドサット計画を筆頭に、衛星リモートセンシングのための最初のデジタル画像処理標準も導入された。1980年代までに、手頃な価格のマイクロプロセッサとメモリの利用可能性によりリアルタイム処理が実現可能となり、産業検査や消費者向け写真撮影への応用につながった。
中核となる技法とアルゴリズム
空間領域フィルタリングは最も基本的な操作であり、ぼかし、シャープ化、エッジ検出などのタスクに畳み込みカーネルを使用する。1968年に導入されたソーベル演算子と、1986年にジョン・キャニーによって発表されたキャニーエッジ検出器は、境界抽出の標準ツールとして今も残っている。1965年にジェームズ・クーリーとジョン・テューキーによって普及した高速フーリエ変換(FFT)などの周波数領域法は、周期的ノイズの効率的なフィルタリングと画像圧縮を可能にする。
膨張や収縮を含むモルフォロジー操作は、二値画像における形状解析とノイズ除去に使用される。ヒストグラム均等化は、強度値を再分布させることでコントラストを強化し、ニューラルネットワークモデルのトレーニングにおけるデータ拡張に広く適用される技法である。復元には、1940年代にノーバート・ウィーナーによって開発されたウィーナーフィルタなどのアルゴリズムが、劣化した観測から元の画像を推定する。
現代のアプローチはますます深層学習を活用している。1989年にヤン・ルクンによって画像分類のために初めて実証された畳み込みニューラルネットワーク(CNN)は、支配的となっている。2015年に何恺明らによって導入されたResNetなどのアーキテクチャは、超解像やノイズ除去などのタスクのために非常に深いネットワークのトレーニングを可能にする。2015年にオラフ・ロンネベルガーによって提案されたU-Netアーキテクチャは、生体医用画像セグメンテーションのために特別に設計されており、ベンチマークとして残っている。
さまざまな分野での応用
医用画像は主要な受益者であり、デジタル処理によりインテュイティブサージカルのダヴィンチシステムが低侵襲手術のために内視鏡画像を強化できるようになった。サムスンリサーチや他の研究所は超音波およびMRI品質の向上に処理を適用し、バーバ原子力研究センターは核画像解析にそれを使用している。放射線学では、コンピュータ支援検出システムがマンモグラムから腫瘍を特定するのを支援しており、この実践は1990年代後半に規制承認を得た。
リモートセンシングと地球観測は、大気歪みの補正と土地利用の分類に処理を依存している。Google CloudとAmazon Web Servicesのプラットフォームは、AWS Trainiumや他の専用ハードウェアを活用した衛星画像解析のためのマネージドサービスを提供している。自動運転車では、ウェイモとテスラオートパイロットが物体検出と車線追跡にリアルタイム画像処理を使用し、機械学習とカメラキャリブレーションなどの古典的技法を組み合わせている。
消費者向けアプリケーションにはスマートフォン写真撮影が含まれ、アップルとサムスン電子はHDRやナイトモードなどの計算写真機能を実装している。adobe(提供されたリストにはない)は1990年にPhotoshopでデジタル写真編集を先駆けたが、基礎となるアルゴリズムは現在すべてのカメラに組み込まれている。セキュリティおよび監視システムは顔検出と認識を使用し、NECと富士通が商用ソリューションを提供している。
機械学習およびAIとの関係
デジタル画像処理と機械学習は深く絡み合っている。古典的処理は、深層学習モデルの堅牢性を向上させる前処理ステップ(正規化、リサイズ、データ拡張)を提供する。逆に、学習されたモデルは現在、画像セグメンテーションや物体検出など、以前は手作りのアルゴリズムを必要とした多くのタスクを実行している。
生成AIの台頭は、画像合成やスタイル転送などの新しい能力を導入した。Stable Diffusionなどのモデルは、ノイズスケジューリングのための処理技法に基づいて、テキストから画像を生成するために拡散プロセスを使用する。OpenAIのDALL-EとGoogle DeepMindのImagen(後者はリストにない)はこの傾向を例示しているが、伝統的な処理ではなくトランスフォーマーアーキテクチャに依存している。
ハードウェアの進歩は進歩を加速させた。NVIDIA(リストにはない)は現在画像処理の標準となっているGPUを開発し、インテルとAMDはCPUに画像信号プロセッサを統合している。AWS TrainiumやGroqのテンソルストリーミングプロセッサなどの専用アクセラレータは、ビジョンモデルの推論を最適化する。クアルコムとARMホールディングスは、専用のビジョン処理ユニットを備えたモバイルチップを設計し、オンデバイスAIを可能にしている。
課題と今後の方向性
高解像度ビデオのリアルタイム処理は依然として課題であり、効率的なアルゴリズムとハードウェアを必要とする。モデルプルーニングと量子化は計算負荷を軽減するが、精度とのトレードオフは残る。監視アプリケーションからプライバシーへの懸念が生じ、差分プライバシー(リストにはない)と連合学習の研究を促しており、アップルとGoogle Cloudはオンデバイス処理を実装している。
新興分野には、環境モニタリングのために数百のスペクトルバンドを捉えるハイパースペクトルイメージングや、光学とアルゴリズムを組み合わせて超解像を達成する計算イメージングが含まれる。マルチモーダルモデルに見られるように、大規模言語モデルの能力とビジョンの統合は、処理が意味的理解によって導かれる未来を示唆している。スタンフォードAIラボとバークレーAIリサーチでの研究は、特に画像のための教師なしおよび自己教師あり学習において、限界を押し広げ続けている。
2020年代半ばの時点で、この分野は人工知能と収束しており、伝統的なアルゴリズムはニューラルネットワークアーキテクチャの帰納的バイアスとして機能している。フェルマータの農業分析などの科学アプリケーションのためのU-Netのようなネットワークの開発は、古典的概念の継続的な関連性を示している。デジタル画像処理は、数学的厳密性と経験的革新のバランスを取りながら、ダイナミックな分野であり続けている。