ヒューマノイドロボットとは、その物理的形状が人体に近似しているロボットであり、典型的には頭部、胴体、手のようなエンドエフェクタを備えた2本の腕、および2本の脚を含み、その設計は、環境を再設計する必要なく、人間向けに構築された空間、工具、および作業フローの中で機械が動作できるようにすることを意図している。このカテゴリは、2000年に発表されたホンダのASIMOや、2013年にDARPA向けに初めて開発されたボストン・ダイナミクスのアトラスなど、数十年にわたる研究プロトタイプを網羅しているが、Reinforcement learningベースの locomotion の進歩、より安価なアクチュエータとバッテリー、および指示とシーンを解釈できる汎用のVision-language modelシステムの出現によって推進され、2022年頃から新たな商業投資の波を集めた。
歴史的発展
初期のヒューマノイド研究は、移動とバランスを中心的な難問として優先した。ASIMOは安定した二足歩行と階段昇降を実証し、一方アトラスは、DARPAプログラムの下で災害対応タスク用に当初構築され、ボストン・ダイナミクスによって開発された走行やバックフリップなどの動的で運動的な動きで知られるようになった。これらのプラットフォームは、学習された知覚ではなく、古典的な制御理論とモデルベースの計画に大きく依存しており、主に研究またはデモンストレーションシステムであり、商業製品ではなく、Roboticsに関する記事で議論されているAIのデジタルと物理的な進歩の間のより広いギャップを反映していた。
2022-2026年の波
ヒューマノイドへの商業的関心は、2022年以降急速に加速した。Elon Muskは2022年にテスラのOptimusプロジェクトを発表し、量産可能な汎用作業ロボットとして、またテスラのSelf-driving car認識スタックの長期的な拡張として位置付けた。OpenAI、Microsoft (AI)、NVIDIAを含む投資家の支援を受けたFigure AIは、2023年から倉庫および製造環境でそのヒューマノイドのパイロット運用を開始し、大規模モデル推論をロボットに統合するためのOpenAIとの広く公表された協力関係を結んだ。他の参入者には、限定的な物流試験ですでに展開されているAgility RoboticsのDigitや、UnitreeやFourier Intelligenceなどの中国メーカーの波が含まれ、ハードウェアコストを引き下げた。ボストン・ダイナミクスは2024年に完全電動版のアトラスを発表し、油圧式の前身を置き換え、研究の重点を純粋に設計された制御から学習された制御へと移行させた。
視覚-言語-行動モデル
2024-2026年の波の背後にある中心的な技術的賭けは、有能なLarge language modelシステムを生み出したのと同じレシピ、すなわち広範なデータで大規模モデルを事前学習し、それをタスクに適応させるという方法が、視覚-言語-行動(VLA)モデルを通じて物理的制御に拡張できるというものである。Vision-language modelバックボーンは、ロボットの関節コマンドを直接出力するように訓練または微調整され、テレオペレーションを介して収集されたデモンストレーションデータで訓練された後、単一のモデルがさまざまな操作および移動タスクにわたって自然言語の指示に従うことを可能にする。Google DeepMindのRT-2と後続の取り組み、およびFigure、Physical Intelligence、その他のロボット工学に焦点を当てた研究所からの同様の研究は、このアプローチの例であり、その支持者は、ヒューマノイドロボットが大規模言語モデルがテキストタスク全体で一般化するのと同じように一般化できる可能性があると主張しているが、利用可能な実世界の物理的訓練データの量は、言語モデルに使用されるテキストコーパスよりもはるかに少ないままである。
見通しと懐疑論
支持者は、ヒューマノイドロボットを、製造、物流、そして最終的には家庭内タスクを大規模に実行できる潜在的な数兆ドル規模の労働市場シフトとして位置付けている。懐疑論者は、ロボット工学のタイムラインが過度に約束されてきた長い歴史を指摘し、器用な操作、バッテリー寿命、およびコストにおける未解決の課題を挙げ、特定のタスクに対しては、タスク固有のロボット設計が汎用のヒューマノイド形状因子をしばしば上回るだろうと主張しており、2020年代後半を通じたヒューマノイド展開のペースと最終的な規模は真に不確実であるとしている。