Gato 1.2B는 신경망 모델로, Google DeepMind가 개발한 1.2억 개의 매개변수를 가진 모델입니다. 이는 트랜스포머 기반의 언어 모델로, 단일 가중치 집합을 사용하여 텍스트 생성, 이미지 캡셔닝, 로봇 제어를 포함한 광범위한 작업을 처리하도록 설계되었습니다. 이 모델은 다양한 환경에서 학습하고 행동할 수 있는 범용 에이전트를 만들기 위한 DeepMind의 노력의 일환으로 2022년에 소개되었습니다.
Gato 1.2B의 아키텍처는 인코더-디코더 설계를 따르지만, 주로 시퀀스-투-시퀀스 모델로 작동합니다. 텍스트, 이미지, 행동이 이산 토큰으로 변환되는 토큰 시퀀스로 입력을 처리합니다. 이 통합된 표현 덕분에 모델은 작업별 수정 없이도 양식 간에 전환할 수 있습니다. 이 모델은 멀티 헤드 어텐션 메커니즘과 위치 인코딩을 사용하여 가변 길이 입력을 처리합니다.
훈련 및 데이터
Gato 1.2B는 책과 웹 페이지의 텍스트, 공개 데이터 세트의 이미지, 시뮬레이션 및 실제 로봇 환경의 시연 데이터로 구성된 다양한 데이터 세트로 훈련되었습니다. 훈련에는 텍스트 및 이미지 토큰에 대한 교차 엔트로피 손실과 행동 토큰에 대한 별도의 손실이 사용되었습니다. 모델은 Adam 옵티마이저와 워밍업 및 코사인 감쇠를 포함한 학습률 스케줄로 최적화되었습니다. 훈련은 Google Cloud TPU에서 수행되었으며, 총 계산 예산은 약 1.1e21 FLOPs였습니다.
기능 및 성능
Gato 1.2B는 Atari 게임 플레이, 캡션 생성, 질문 응답, 로봇 팔 제어를 포함한 600개 이상의 작업에서 능숙함을 보여줍니다. 평가에서 Atari 스위트에서 중앙값 50%의 점수를 달성하여 이전의 범용 모델보다 우수했지만 전문 에이전트보다는 낮았습니다. 로봇 제어의 경우 블록 쌓기 및 물체 배치와 같은 실제 작업에서 테스트되었으며, 일부 경우 전문 정책과 비슷한 성공률을 달성했습니다. 모델이 작업 간에 일반화하는 능력은 대규모 사전 훈련과 공유 토큰 어휘 덕분으로 여겨집니다.
다른 모델과의 비교
Gato 1.2B는 종종 OpenAI의 GPT-3 및 Anthropic의 Claude와 같은 다른 범용 모델과 비교되지만, 멀티모달 및 구현 작업에 초점을 맞춘다는 점에서 다릅니다. 순수한 언어 모델과 달리 Gato는 시각 및 행동 데이터를 통합하여 인공 일반 지능을 향한 한 걸음입니다. 매개변수 수는 GPT-3의 175억 개와 같은 많은 현대 모델보다 적지만, 특화된 훈련 덕분에 더 좁은 범위의 작업에서 경쟁력 있는 성능을 달성합니다.
한계 및 향후 방향
다재다능함에도 불구하고 Gato 1.2B에는 한계가 있습니다. 장기 지평 작업에 어려움을 겪으며 이미지와 행동의 신중한 토큰화가 필요합니다. 훈련 분포를 벗어난 작업에서는 성능이 저하됩니다. DeepMind의 연구자들은 모델 확장과 일반화 개선을 위한 더 다양한 데이터 통합을 모색했습니다. 이 모델은 유익한 응용과 유해한 응용 모두에 사용될 수 있으므로 안전성과 제어에 대한 의문도 제기합니다. 향후 작업에는 인간 피드백 기반 강화 학습 및 커리큘럼 학습을 통합하여 기능을 향상시키는 것이 포함됩니다.
반응 및 영향
Gato 1.2B는 여러 도메인을 위한 단일 에이전트라는 야심 찬 목표로 머신 러닝 커뮤니티에서 좋은 반응을 얻었습니다. 이는 범용 AI로 가는 경로와 멀티모달 훈련의 중요성에 대한 논의를 촉발했습니다. 모델의 코드와 가중치는 완전히 공개되지 않았지만, 아키텍처와 훈련 세부 사항은 기술 보고서에 게시되었습니다. 이는 RT-2 및 SIMA와 같은 DeepMind의 이후 모델을 포함한 범용 에이전트에 대한 후속 연구에 영향을 미쳤습니다.