译自英文

Gato 1.2B 是由 Google DeepMind 开发的一个拥有 12 亿参数的基于 Transformer 的神经网络,用于跨文本、图像和控制的多模态任务。

Gato 1.2B 是由Google DeepMind开发的一种神经网络模型,拥有12亿参数。它是一种基于Transformer (architecture)语言模型,旨在使用单一权重集处理广泛的任务,包括文本生成、图像描述和机器人控制。该模型于2022年推出,是DeepMind致力于创建能够在多种环境中学习和行动的通用智能体的一部分。

Gato 1.2B的架构遵循Encoder-Decoder Architecture设计,尽管它主要作为序列到序列模型运行。它将输入处理为令牌序列,其中文本、图像和动作被转换为离散令牌。这种统一表示允许模型在无需任务特定修改的情况下切换模态。该模型采用多头注意力机制和位置编码来处理可变长度输入。

训练与数据

Gato 1.2B在多样化的数据集上进行了训练,包括书籍和网页文本、公共数据集中的图像,以及模拟和真实世界机器人环境中的演示数据。训练使用交叉熵损失处理文本和图像令牌,并为动作令牌使用单独的损失。模型通过Adam优化器和包含预热及余弦衰减的学习率调度进行优化。训练在Google Cloud TPU上进行,总计算预算约为1.1e21 FLOPs。

能力与性能

Gato 1.2B在超过600项任务中表现出色,包括玩Atari游戏、生成描述、回答问题以及控制机械臂。在评估中,它在Atari套件上取得了50%的中位分数,优于先前的通用模型,但仍低于专业智能体。对于机器人控制,该模型在堆叠积木和放置物体等真实世界任务中进行了测试,在某些情况下取得了与专业策略相当的成功率。该模型跨任务泛化的能力归因于其大规模预训练和共享令牌词汇表。

与其他模型的比较

Gato 1.2B常与OpenAI的GPT-3和Anthropic的Claude等其他通用模型进行比较,但它在多模态和具身任务上的关注点有所不同。与纯语言模型不同,Gato整合了视觉和动作数据,使其朝着通用人工智能迈出了一步。其参数数量小于许多当代模型,如GPT-3的1750亿参数,但由于其专门训练,它在较窄的任务范围内取得了有竞争力的性能。

局限性与未来方向

尽管具有多功能性,Gato 1.2B仍存在局限性。它在长时程任务上表现不佳,并且需要对图像和动作进行仔细的令牌化。其性能在训练分布之外的任务上会下降。DeepMind的研究人员已探索扩展模型规模并纳入更多样化的数据以改善泛化能力。该模型还引发了关于安全性和控制的问题,因为它既可用于有益应用,也可用于有害应用。未来工作包括整合基于人类反馈的强化学习课程学习以增强其能力。

反响与影响

Gato 1.2B在机器学习社区中因其在多个领域实现单一智能体的雄心目标而受到好评。它引发了关于通用AI路径和多模态训练重要性的讨论。该模型的代码和权重并未完全开源,但其架构和训练细节已在技术报告中发布。它影响了后续关于通用智能体的研究,包括DeepMind后来的模型如RT-2和SIMA。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:neural-network·transformer·multimodal-ai·deepmind
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史