DexNet은 로봇 파지 및 정교한 조작을 위해 개발된 심층 신경망 모델 계열이다. 이 시스템은 손으로 코딩된 기하학적 규칙에 의존하지 않고, 주로 깊이 이미지와 같은 센서 데이터에서 직접 파지 계획을 학습한다. 핵심 혁신은 시뮬레이션에서 생성된 대량의 합성 훈련 데이터를 사용한다는 점이며, 이를 통해 모델이 실제 환경의 새로운 물체로 일반화할 수 있다. DexNet은 캘리포니아 대학교 버클리 캠퍼스의 일련의 연구 논문에서 소개되었으며, 이후 로봇 학습 및 조작 연구에 영향을 미쳤다.
DexNet의 주요 목표는 다지 로봇 손으로 알 수 없는 물체를 파지하는 문제를 해결하는 것이다. 전통적인 파지 계획은 종종 정밀한 3D 모델과 복잡한 기하학적 분석을 요구하며, 이는 비구조화된 환경에서 취약하다. DexNet은 대신 파지를 학습 문제로 구성한다. 물체의 깊이 이미지가 주어지면 모델은 후보 파지 구성을 예측하고 성공 가능성을 점수화한다. 가장 높은 점수를 받은 파지가 로봇에 의해 실행된다. 이러한 데이터 기반 접근 방식은 시스템이 훈련 중에 본 적 없는 물체 모양을 포함한 다양한 물체 형태를 처리할 수 있게 한다.
구조 및 훈련
DexNet 모델은 이미지 데이터 처리에 적합한 딥러닝 구조 유형인 합성곱 신경망(CNN)을 기반으로 한다. 네트워크의 입력은 장면의 각 지점까지의 센서 거리를 인코딩하는 깊이 이미지이다. 네트워크는 여러 합성곱 계층을 통해 이 이미지를 처리하여 물체 모양, 표면 방향, 국소 기하학과 관련된 특징을 추출한다. 이러한 특징은 완전 연결 계층에 공급되어 이산적인 후보 파지 집합 각각에 대한 점수를 출력한다.
훈련 과정은 도메인 무작위화라는 기법에 의존한다. 연구자들은 테이블 위에 무작위 포즈로 배치된 무작위 물체(직육면체, 원통 및 더 복잡한 모양 포함)를 시뮬레이션하여 수백만 개의 합성 깊이 이미지를 생성한다. 각 합성 장면에 대해 물리 엔진을 사용하여 물리적으로 유효한 파지 집합을 계산하고 각 파지를 성공 또는 실패로 라벨링한다. 네트워크는 손실 함수인 교차 엔트로피와 같은 표준 지도 학습을 사용하여 이러한 라벨을 예측하도록 훈련된다. 시뮬레이션과 현실 간의 격차를 줄이기 위해 합성 이미지에는 무작위 잡음, 다양한 조명, 다양한 카메라 각도가 포함되어 모델이 실제 센서 결함에 강건해진다.
버전 및 발전
DexNet 프로젝트는 각각 이전 버전을 개선한 여러 버전을 생성했다. 2016년에 소개된 DexNet 1.0은 단일 CNN을 사용하여 깊이 이미지에서 파지를 점수화했으며, 두 손가락 그리퍼로 새로운 물체 테스트 세트에서 94%의 성공률을 달성했다. 2017년에 출시된 DexNet 2.0은 접근 방식을 다지 손(알레그로 손)으로 확장하고 더 정교한 파지 표현을 통합하여 더 넓은 범위의 손 구성을 허용했다. 2018년에 발표된 DexNet 3.0은 물체가 쌓여 있는 복잡한 장면에서의 파지 문제에 초점을 맞췄다. 이 버전은 두 단계 파이프라인을 사용했다. 먼저 분할 네트워크가 개별 물체를 분리하고, 그런 다음 파지 네트워크가 각 세그먼트에서 파지를 평가했다. 이 버전은 창고 자동화의 일반적인 작업인 빈에서 물품을 집는 데 강력한 성능을 입증했다.
응용 및 영향
DexNet은 여러 산업 및 연구 환경에 적용되었다. 주요 사용 사례는 로봇 피킹 및 패킹으로, 로봇이 빈이나 컨베이어 벨트에서 물체를 식별하고 파지해야 한다. 보이지 않는 물체로 일반화하는 시스템의 능력은 품목 다양성이 높은 전자상거래 주문 처리에 적합하다. 연구자들은 출력 표현을 수정하여 밀기 및 배치와 같은 다른 조작 작업에도 DexNet을 적용했다. DexNet이 도입한 합성 데이터 훈련 패러다임은 로봇 학습의 표준 관행이 되었으며, 이후 오픈AI 및 구글 딥마인드의 시스템과 같은 후속 시스템에 영향을 미쳤다.
한계 및 향후 방향
성공에도 불구하고 DexNet에는 알려진 한계가 있다. 모델은 주로 강체 물체에 대해 훈련되었으며, 천이나 식품과 같은 변형 가능한 물체는 여전히 어려운 과제이다. 또한 정적 카메라와 알려진 로봇 손을 가정하므로 다른 하드웨어에는 재훈련이 필요하다. 파지 품질 점수는 복잡한 내부 공동이나 매우 얇은 구조를 가진 물체에 대해 항상 신뢰할 수 있는 것은 아니다. 향후 연구에서는 DexNet을 강화 학습과 결합하여 시행착오를 통해 파지를 개선하고, 촉각 센서를 통합하여 파지 중 피드백을 개선하는 방안을 모색했다. 2020년대 초반 현재 DexNet의 원리는 로봇 공학을 위한 생성형 AI 연구에 계속 영향을 미치고 있으며, 여기서 모델은 파지뿐만 아니라 전체 조작 계획을 생성한다.
같이 보기
참고 문헌
DexNet 논문은 IEEE 국제 로봇 공학 및 자동화 회의(ICRA)와 로봇 학습 회의(CoRL)를 포함한 주요 로봇 공학 및 머신러닝 회의에서 발표되었다. 원본 코드와 데이터 세트는 공개적으로 공개되어 추가 연구를 촉진했다.
Category:Robotics
Category:Deep learning
Category:Grasping