机器人学是工程学与计算机科学的一个分支,涉及设计、建造、操作和编程物理机器(即机器人),使其感知环境并在其中采取物理行动。虽然机器人学的历史比现代人工智能早数十年,可追溯至1960年代起在工厂车间部署的工业机械臂,但随着感知、规划和控制从手工编码规则转向学习模型,该领域与人工智能的融合日益紧密,这种融合常在具身智能这一更广泛的标题下讨论。
从工业机器人到学习型机器人
早期的工业机器人,例如1961年安装于通用汽车工厂的Unimate机械臂,在严格受控的环境中通过固定的、预编程的运动序列运行,无需感知非结构化世界。1980年代和1990年代的研究型机器人学,以罗德尼·布鲁克斯的包容架构机器人为代表,探索了反应式、传感器驱动的控制,作为符号规划的替代方案。2004年和2005年的DARPA大挑战竞赛要求自动驾驶车辆在沙漠中导航,被广泛认为推动了现代机器人感知与规划研究,并催生了自动驾驶汽车产业。在随后的二十年里,计算机视觉和强化学习逐渐取代了手工设计的规则,用于抓取、移动和导航等任务,使得主要在仿真中训练的机器人能在一定程度上泛化到物理世界,这种迁移通常被称为“仿真到现实”。
人工智能驱动的感知与控制
现代机器人学大量借鉴了人工智能其他领域使用的深度学习技术。卷积神经网络以及后来的视觉语言模型系统赋予机器人识别物体和场景的能力;强化学习和模仿学习(机器人通过模仿记录的人类示范来学习)用于训练控制策略;自2020年代初以来,视觉-语言-动作(VLA)模型将大型预训练视觉语言模型骨干与直接生成机器人电机指令的输出头相结合,使单一模型能够跨多种物理任务遵循自然语言指令。这催生了一波通用机器人基础模型浪潮,既有成熟的机器人实验室,也有新进入该领域的人工智能公司参与其中。
应用领域
工业与仓储机器人仍是最大的部署基础,机械臂和自主移动机器人在制造和物流中广泛使用,包括亚马逊等公司运营的大型履约中心。手术机器人以达芬奇系统为代表,通过遥操作器械扩展外科医生的精度。农业机器人负责收割和作物监测,而家用机器人(最成功的是扫地机器人)是迄今为止最广泛采用的消费类产品。人形机器人平台旨在人类设计的环境中执行通用任务,而自动驾驶汽车系统则是截至2020年代中期该领域资本最密集、最受关注的前沿方向。
挑战
尽管人工智能进展迅速,机器人学在历史上比纯数字人工智能应用发展更慢,这种差距有时被概括为莫拉维克悖论:对人类来说微不足道的任务(如拿起形状不规则的物体或在崎岖地形上行走)对机器而言仍然困难,而人类觉得困难的任务(如复杂计算)对计算机来说相对容易。物理机器人还面临纯软件人工智能系统所没有的约束,包括硬件成本、耐用性、人类周围的安全性,以及收集大规模、多样化真实世界训练数据的难度,这些数据难以与训练现代大语言模型和文本到图像系统的互联网规模文本和图像语料库相媲美。