ニューラル放射輝度場(NeRF)は、2次元画像からシーンの3次元表現を再構成するために用いられるニューラルフィールドである。このモデルにより、新規視点合成、シーン形状の再構成、シーンの反射特性の取得といった下流アプリケーションが可能になる。カメラのポーズなどの追加のプロパティも同時に学習できる。2020年に初めて発表されて以来、NeRFはコンピュータグラフィックスとコンテンツ制作の分野で大きな注目を集めている。
中核となるアイデアは、シーンをニューラルネットワークによって近似される連続関数として表現することである。空間位置と視方向が与えられると、ネットワークは色と密度を出力し、従来のボリュームレンダリングを用いて任意の視点から画像を生成できるようにする。
アルゴリズム
NeRFアルゴリズムは、シーンを深層ニューラルネットワークによってパラメータ化された放射輝度場として表現する。ネットワークは、3次元座標(x, y, z)とオイラー角による視方向が与えられると、ボリューム密度と視点依存の放射輝度を予測する。カメラ光線に沿って多数の点をサンプリングすることで、従来のボリュームレンダリング技術によって画像が生成される。
このプロセスは完全に微分可能である。各カメラ光線について、ネットワークは点をサンプリングし、密度と色を予測し、それらを合成してピクセル値をレンダリングする。この設計により、勾配降下法を用いて入力画像に対して直接最適化でき、ネットワークが一貫性のあるボリュームモデルを学習することを促進する。
データ収集
NeRFは、個々のシーンごとに再学習する必要がある。最初のステップは、異なる角度から画像を収集し、それに対応するカメラのポーズを記録することである。標準的な2次元画像で十分であり、特殊なカメラやソフトウェアは不要である。任意のカメラで、設定と撮影方法がStructure-from-Motion(SfM)の要件を満たしていれば、データセットを生成できる。
カメラの位置と向きは、多くの場合、SLAM(同時位置推定と地図作成)、GPS、または慣性計測の組み合わせによって追跡される。研究者は、従来の非学習型手法でレンダリングされた画像が再現可能でエラーのないカメラポーズを提供するため、評価には合成データを頻繁に使用する。
学習
各スパースな視点について、カメラ光線がシーン内を進み、対応する放射方向に3次元点が生成される。多層パーセプトロン(MLP)は、これらの点についてボリューム密度と放射輝度を予測する。その後、古典的なボリュームレンダリングによって画像が生成される。パイプライン全体が微分可能であるため、予測画像と元の画像との誤差は、複数の視点にわたる勾配降下法によって最小化され、MLPが一貫性のある3次元表現を学習するように導かれる。
バリエーションと改良
初期のNeRFは最適化が遅く、すべての入力ビューが同じカメラ設定と一貫した照明条件下で撮影されている必要があった。ドラムセット、植物、小さな玩具などの個々の物体を周回するショットで最も良い結果が得られた。2020年以降、多くの改良により、使いやすさと学習速度が大幅に向上した。
フーリエ特徴マッピング
2020年の元の論文の直後、フーリエ特徴マッピングによって学習速度と精度が向上した。深層ニューラルネットワークは、低次元の領域で高周波数の関数を学習するのが苦手であり、これはスペクトルバイアスとして知られる現象である。この問題を克服するために、入力点はMLPに供給される前に、正弦波と余弦波の変換を用いて高次元の特徴空間にマッピングされ、ネットワークが微細な幾何学的テクスチャとディテールを表現できるようにする。
その他の発展
その後の進歩には、表面近くでより多くのサンプルを割り当てる階層的サンプリング戦略、露光や照明の変化に対応するバリアント、深度事前情報を組み込んで収束を高速化する手法などが含まれる。一部のバージョンでは、NeRFを機械学習フレームワークと組み合わせてカメラパラメータを直接推定し、前処理の負担を軽減している。グリッドやハイブリッド表現を用いた効率的な実装により、学習時間は数時間から数分に短縮された。
応用
NeRF技術は、生成AIやコンピュータグラフィックスにおけるさまざまな用途を支えている。コンテンツ制作者は、物体のスパースな写真セットからフライアラウンドビューを生成するためにNeRFを使用し、仮想博物館や小売製品のプレゼンテーションを強化している。また、文化遺産の保存やロボット工学におけるシーン形状の抽出にも応用されている。特定の視点密度が必要であるという固有の制約が、リアルタイムアプリケーションを制限し続けているが、現在進行中の研究がこの問題に対処している。
深層学習との相互作用により、NeRFはシーンレンダリングと3次元シーン理解の中心的な技術として位置づけられており、コンピュータビジョンとコンピュータグラフィックスのコミュニティで広く研究されている。Google DeepMindなどの企業や学術研究所は、この分野に重要な貢献を続けている。
関連項目
- 機械学習
- ボリュームレンダリング
- 新規視点合成
- Structure from Motion