コンピュータビジョンにおいて、キュボイド(cuboid)という用語は、行動認識の目的で抽出される小さな時空間ボリュームを指す。これは基本的な幾何プリミティブの一種と見なされ、平坦な2次元画像の3次元的表現内で3次元オブジェクトを描写するために使用される。キュボイドはオブジェクトの簡略化された体積近似を提供し、ソフトウェアが詳細な外見モデルに頼るのではなく、幾何学的な記述を通じてシーンを分析できるようにする。
この概念は、コンピュータビジョンや機械学習における幾何プリミティブのより広範な使用に基づいており、箱、円柱、球などの基本形状がシーン理解のための構成要素として機能する。キュボイドは特に、オブジェクトまたは関心領域の周囲に長方形の箱状のフィットを提供し、空間と時間の両方でその空間的な広がりを捉える。これにより、ビデオフレーム全体でアクションの追跡や認識を必要とするタスクに特に有用であり、空間時間ボリュームが短い間隔での動きや形状の変化を符号化するためである。
生成
キュボイドは、2次元画像と3次元画像の両方から生成できる。一つの方法では、SUN(Scene Understanding)プリミティブデータベースを使用する。これは、既にキュボイドを含む多くの画像の集合である。SUNプリミティブデータベースを機械学習ツールで選別することで、コンピュータは画像内でキュボイドが生成される条件を観察し、他の画像からキュボイドを生成することを学習する。このアプローチは教師あり学習に依存しており、ラベル付けされた例がアルゴリズムにキュボイドを識別し新しいデータにフィットさせる方法を教える。
RGB-D画像は、各ピクセルの奥行きも記録するRGB画像であり、キュボイドの生成に使用されることもある。奥行きが既に記録されているため、コンピュータはカメラからのオブジェクトの距離を推定する必要がなくなり、フィットプロセスが簡素化される。これは、ロボット工学や拡張現実アプリケーションなど、奥行きセンサーが一般的であるインテリア環境で特に有利である。
キュボイドの生成は、色と照明、遮蔽、背景の乱雑さの変化に敏感である。これは、コンピュータが多色である、照明が不規則である、または部分的に覆われているオブジェクト、あるいは背景に多くのオブジェクトが現れる場合に、キュボイドを生成するのが困難であることを意味する。この制限は、キュボイド生成アルゴリズムが比較的単純であり、しばしば視覚的ノイズによって妨害されるエッジ検出や色セグメンテーションに依存するという事実に一部起因している。
用途
キュボイドは、ポイントクラウドベースの3次元マップ用に生成され、拡張現実、自動車、ドローン、ロボットの自動制御、オブジェクト検出など、さまざまな状況で利用できる。これらの文脈では、キュボイドは生のポイントクラウドデータの複雑性を低下させる簡潔な表現として機能し、システムが空間的な関係を効率的に推論できるようにする。
キュボイドは、ソフトウェアが「オブジェクトに依存しない」方法で幾何学的記述を用いてシーンを特定することを可能にする。これは、実際のオブジェクトの特定の出現を認識するのではなく、システムが空間レイアウトと体積占有率に焦点を当てており、異なる種類のオブジェクトや環境に適用でき、ナビゲーションやマッピングに価値があり、目標は自由空間や障害物を理解することであり、各アイテムを特定することではない。
2次元の画像から作成された関心点は、画像内の位置をコンピュータが画像を認識するために重要と特定し、キュボイドと共に画像マッチング、部屋やシーンの特定、インスタンス認識に使用される。3次元の画像から作成された関心点は、キュボイドと共にアクティビティを認識するために使用できる。これは、関心点がソフトウェアが画像の最も重要な側面のみに焦点を当て、計算負荷を削減し、堅牢性を高ため可能である。
SLAMおよびCADとの統合
RGB-D画像とSLAMシステムは、RGB-D SLAMシステムで共に使用され、CADシステムのポイントクラベースの3次元マップを生成に使用される。このようなシステムでは、キュボイドは再構成されたポイントクラウドから抽出され、セマンティックまたは幾何学的なアンカーを提供し、オブジェクト配置やシーン編集のようなタスクを簡素化する。
産業用マルチ軸加工ツールのほとんどは、コンピュータ支援製造を使用し、続いてキュビック作業空間で作業する。これは、同様の使用法であり、加工に利用可能な物理的なボリュームが、工具パスプランニングや衝突回避のためにキュボイドと近似にされる。キュボイドの幾何学的シンプルさは、これらの産業用途でコンピュータ的に扱いやすくする。
課題と今後の方向性
その有用性にもかかわらず、キュボイドベースの手法は複雑なシーンでの課題に直面している。照明や遮蔽に対する感度は、屋外や動的な環境での信頼性を低下させる。研究者は、ディープラーニングやニューラルネットワークに基づくものなど、より堅牢なアルゴリズムを探求しており、キュボイドの検出とフィットを改善している。たとえば、残差ネットワークやU-Netアーキテクチャが、キュボイド候補を出力できるセマンティックセグメンテーションタスクに適用されている。
もう一つの方向性は、キュボイドをデータ拡張手法と統合して、照明条件やオブジェクトの外観にわたってよりよく一般化できるモデルをトレーニングすることである。さらに、トレーニングパイプラインでのバッチ正規化やドロップアウトの使用は、ノイズのある深さデータを扱う際に学習を安定化させてくれる。
関連概念
キュボッドは、バウンディングボックスや方向バウンディングボックスなどコンピュータビジョンで使用される他の幾何プリミティプと密接に関連している。バウンディングボックスは主に2次元オブジェクト検出で使用され、軸に沿って並んでいるが、キュボイッドはこれを3次元空間と時間に拡張する。アクティビティ認識では、キュビッドはハリス3Dやビデオに適応されたSIFTなどの関心点検出器と同様に、時間的特徴抽出の形態と見なすことができる。
キュボイドの生成には、教師あり学習や教師なし学習重みを含む機械学習技術がしばしば使用される。特に、畳み込みニューラルネットワークは、伝統的な手設計の特徴をバイパスして画像からのキュボイドパラメータを直接予測するために使用されてきた。これは、(人工知能) における広いトレンド、つまり ディープラーニングモデルが手動パイプラインを置き換えていく、という傾向と一致している。
その他関連
コンピュータビジョン