DexNet是一个深度神经网络模型系列,专为机器人抓取和灵巧操作而开发。该系统直接从传感器数据(主要是深度图像)学习规划抓取,而不依赖手工编码的几何规则。其核心创新在于使用在仿真中生成的海量合成训练数据,这使模型能够泛化到真实世界中的新颖物体。DexNet由加州大学伯克利分校的一系列研究论文引入,并影响了后续机器人学习和操作领域的工作。
DexNet的主要目标是解决用多指机械手抓取未知物体的挑战。传统的抓取规划通常需要精确的三维模型和复杂的几何分析,这在非结构化环境中较为脆弱。DexNet则将抓取问题重新定义为学习问题:给定物体的深度图像,模型预测一组候选抓取配置,并对其成功可能性进行评分。得分最高的抓取随后由机器人执行。这种数据驱动的方法使系统能够处理各种物体形状,包括训练中从未见过的形状。
架构与训练
DexNet模型基于卷积神经网络(CNN),这是一种适合处理图像数据的Deep learning架构。输入到原网络的是一张深度图像,其中编码了从传感器到场景中每个点的距离。网络通过多个卷积层处理这张图像,提取与物体形状、表面方向和局部几何相关的特征。这些特征随后被输入到全连接层,输出对每组离散候选抓取的评分。
其训练过程依赖于一种称为域随机的技术。研究人员通过模拟随机物体(包括长方体、圆柱体以及更复杂的形状)生成数百万张合成深度图像,这些物体以随机姿态放置在桌面上。对于每个场景,他们使用物理引擎计算一组物理上有效的抓取,并将每次抓取标记为目标物体或失败。网络使用标准的监督学习来预测这些标签,并使用损失函数(如交叉熵)进行训练。为了弥合仿真与现实之间的差距,合成图像包含随机噪声、变化的照明和不同的相机角度,这使模型对真实世界的传感器缺陷具有鲁棒性。
版本与演变
DexNet项目产生了多个版本,每个版本都对前一版本进行了改进。DexNet 1.0,于2016年推出,使用单个CNN从深度图像中评分抓取,在由新颖物体构成的测试集上,使用两指夹具取得了94%的成功率。DexNet 2.0,于2017年发布,将该方法扩展到多指手(Allegro手),并加入了更复杂的抓取表示,从而允许更广泛的手部配置。DexNet 3.0,于2018年提出,专注于杂乱场景中的抓取问题,其中物体堆积在一起。它使用两阶段流程:首先,一个分割网络分离出单个物体,然后,一个抓取网络评估每个片段上的抓取。该版本在从料箱中取物方面展示出了稳健的性能,这是仓库自动化中的常见任务。
的应用与影响
DexNet已被应用于多个工业和研究场景。其主要用途是机器人拣选和包装,其中机器人必须从料箱或传送带上识别并抓取物体。该系统对未见物体的泛化能力使其适合电子商务履行,此类场景中物品种类繁多。这些研究人员还通过修改输出表示,将DexNet适配用于其他操作任务,如推动和放置。DexNet引入的合成数据训练范式已成为机器人学习中的标准做法,影响了后来来自OpenAI和Google DeepMind等的系统处理。
局限性,以及未来方向
尽管取得了成功,DexNet仍存在已知的局限性。该模型主要针对刚性物体训练;布料或食品等可变形物品仍然具有挑战性。它假设环境相机固定且机械手已知,否则需要针对不同硬件进行重新训练。对于具有复杂内部空腔或极薄结构的物体,抓取质量评分可能并不总是可靠。未来的工作已探索将DexNet与强化学习专业知识,以通过试错改进抓取,并整合触觉传感器以增强抓取过程中的反馈。截至21世纪20年代早期,DexNet的原理继续为机器人学中的Generative AI研究提供信息,这类模型中生成的不只抓取,还有完整的操作计划。
另见(See Also)
参考文献
DexNet论文发表于主要机器学习和机器人学会议,包括电气和电子工程师协会国际机器人与自动化大会(ICRA)和机器人学习会议(CoRL)。原作者代码和数据集已公开,促进了进一步研究。
Category:机器人学
Category:深度学习
Category:抓取