Gato 是一个由 Google DeepMind 开发的通用人工智能系统,于2022年首次公布。它是一个单一的神经网络,经过训练可执行604项不同的任务,涵盖文本生成、图像识别、机器人控制和游戏玩法。Gato 的设计基于Transformer (architecture)架构,这与大型语言模型所用的基础相同,但将其扩展以处理多模态输入和输出,包括文本、图像和连续控制信号。
该系统被引入时旨在证明,一个单一模型无需针对特定任务进行微调,即可在广泛领域内达到胜任水平。虽然并非在每项任务上都超越专用系统,但 Gato 凸显了AI研究中通用智能体的潜力,与构建更灵活、适应性更强的模型的更广泛努力相一致。
架构与训练
Gato 的架构是一个基于 transformer 的序列模型,处理来自不同模态的令牌。图像等输入通过视觉编码器处理,而文本和离散动作则直接进行令牌化。连续控制输出(如机器人的关节扭矩)被离散化为区间。该模型使用标准的机器学习目标,,预测序列中的下一个令牌,,在所有任务类型上进行训练。
训练数据来自多种来源,包括文本语料库、图像数据集、游戏录制以及真实世界的机器人操作演示。该模型约有12亿个参数,与同期的大型语言模型相比相对较小。训练使用了一个 TPUv3 pod,体现了数据和计算使用上的效率。
能力与任务
Gato 在604项任务上进行了评估,涵盖的类别包括:
- 文本任务:回答问题、摘要生成和对话生成。
- 视觉任务:图像描述和物体识别。
- 游戏玩法:Atari 游戏和国际象棋环境,达到业余水平的表现。
- 机器人技术:控制真实机器人手臂堆叠方块和操作物体。
该模型展示了正迁移,即在一组任务上的训练提高了其他任务的表现。例如,接触文本和图像数据有助于机器人控制任务,这表明跨模态的共享表示是有益的。
意义与反响
Gato 因其广度而非深度而引人注目。它在大多数任务上达到或超过了专家表现的50%,这是研究人员用来衡量通用智能体能力的基准。该系统被视为迈向人工通用智能的一步,尽管专家指出它缺乏专用模型的深度专业化。
批评者指出,Gato 在个别任务上的表现往往低于最先进的系统,并且“通用”的概念受限于固定的任务集。尽管如此,它影响了后续在生成式AI和多任务学习方面的研究,特别是在DeepMind和更广泛的AI社区内。
与其他模型的关系
Gato 与大型语言模型(如来自OpenAI和Anthropic的模型)共享概念根源,但不同之处在于它明确关注控制和多模态集成。与纯文本模型不同,Gato 可以与物理和模拟环境交互,使其更接近具身AI系统。它也与深度学习中在单一架构下统一不同任务的努力相呼应,这一趋势在后续模型中得以延续。
遗产与未来方向
Gato 的发布引发了关于扩展通用智能体的讨论。该领域的后续工作探索了更大的模型、更多样化的任务集和改进的训练技术。虽然 Gato 本身并未商业部署,但其原则影响了后来的 DeepMind 项目,并促进了向处理多种模态的基础模型的更广泛转变。
截至2025年,单一模型执行数百项任务的概念仍是一个活跃的研究领域,Gato 作为早期的概念验证。其遗产在于证明了统一架构可以在各领域达到合理表现,为更强大的通用系统铺平了道路。