人形机器人是一种外形近似人体的机器人,通常包括头部、躯干、两条带有手状末端执行器的手臂和两条腿,其设计目的是让机器能够在为人类建造的空间、工具和工作流程中运作,而无需重新设计环境。这一类别涵盖了几十年的研究原型,包括2000年亮相的本田ASIMO,以及2013年最初为DARPA开发的波士顿动力Atlas,但自2022年左右起,它吸引了新一轮商业投资浪潮,这得益于基于Reinforcement learning的运动控制进步、更便宜的执行器和电池,以及能够解释指令和场景的通用Vision-language model系统的出现。
历史发展
早期人形机器人研究将运动与平衡视为核心难题:ASIMO展示了稳定的双足行走和爬楼梯能力,而最初为DARPA项目下的灾难响应任务建造的Atlas,则因波士顿动力开发的跑步和后空翻等动态、运动型动作而闻名。这些平台严重依赖经典控制理论和基于模型的规划,而非学习型感知,且大多是研究或演示系统而非商业产品,反映了Robotics一文中讨论的人工智能数字与物理进展之间的更广泛差距。
2022-2026年浪潮
从2022年起,人形机器人的商业兴趣急剧加速。Elon Musk于2022年推出了特斯拉的Optimus项目,将其定位为可大规模制造的通用工人机器人,以及特斯拉Self-driving car感知栈的长期延伸。Figure AI,其投资者包括OpenAI、Microsoft (AI)和NVIDIA,自2023年开始在仓库和制造环境中试点其人形机器人,并与OpenAI达成了广为人知的合作,将其大模型推理能力集成到机器人中。其他进入者包括Agility Robotics的Digit,已在有限的物流试验中部署,以及优必选和傅利叶智能等一批中国制造商,它们降低了硬件成本。波士顿动力于2024年推出了全电动版Atlas,取代了其液压前身,并将其研究重点转向学习型而非纯工程化的控制。
视觉-语言-动作模型
2024-2026年浪潮背后的核心技术赌注是,产生强大Large language model系统的相同方法,即在广泛数据上预训练大模型然后针对任务进行适配,可以通过视觉-语言-动作(VLA)模型扩展到物理控制:一个Vision-language model骨干网络被训练或微调以直接输出机器人关节命令,使得单一模型在通过遥操作收集的演示数据训练后,能够遵循自然语言指令执行一系列操作和运动任务。Google DeepMind的RT-2及其后续工作,以及Figure、Physical Intelligence和其他机器人实验室的类似研究,都是这种方法的例子,其支持者认为这能让