Gato 1.2B es un modelo de red neuronal desarrollado por Google DeepMind con 1.2 mil millones de parámetros. Es un Transformer (architecture)-basado modelo de lenguaje diseñado para manejar una amplia gama de tareas, incluyendo generación de texto, descripción de imágenes y control robótico, utilizando un único conjunto de pesos. El modelo fue introducido en 2022 como parte del esfuerzo de DeepMind para crear un agente de propósito general capaz de aprender y actuar en diversos entornos.
La arquitectura de Gato 1.2B sigue el diseño Encoder-Decoder Architecture, aunque opera principalmente como un modelo de secuencia a secuencia. Procesa las entradas como secuencias de tokens, donde texto, imágenes y acciones se convierten en tokens discretos. Esta representación unificada permite al modelo cambiar entre modalidades sin modificaciones específicas de la tarea. El modelo emplea mecanismos de atención de múltiples cabezas y codificaciones posicionales para manejar entradas de longitud variable.
Entrenamiento y Datos
Gato 1.2B fue entrenado en un conjunto de datos diverso que comprende texto de libros y páginas web, imágenes de conjuntos de datos públicos y datos de demostración de entornos robóticos simulados y del mundo real. El entrenamiento utilizó una pérdida de entropía cruzada para tokens de texto e imagen y una pérdida separada para tokens de acción. El modelo fue optimizado con el optimizador Adam y un programa de tasa de aprendizaje que incluía calentamiento y decaimiento coseno. El entrenamiento se realizó en TPUs de Google Cloud, con un presupuesto computacional total de aproximadamente 1.1e21 FLOPs.
Capacidades y Rendimiento
Gato 1.2B demuestra competencia en más de 600 tareas, incluyendo jugar juegos de Atari, generar descripciones, responder preguntas y controlar un brazo robótico. En evaluaciones, logró una puntuación mediana del 50% en el conjunto de Atari, superando a modelos generalistas anteriores pero aún por debajo de agentes especializados. Para el control robótico, el modelo fue probado en tareas del mundo real como apilar bloques y colocar objetos, logrando tasas de éxito comparables a políticas especializadas en algunos casos. La capacidad del modelo para generalizar entre tareas se atribuye a su preentrenamiento a gran escala y al vocabulario de tokens compartido.
Comparación con Otros Modelos
Gato 1.2B se compara a menudo con otros modelos generalistas como GPT-3 de OpenAI y Claude de Anthropic, pero difiere en su enfoque en tareas multimodales y encarnadas. A diferencia de los modelos de lenguaje puros, Gato integra datos visuales y de acción, lo que lo convierte en un paso hacia la inteligencia artificial general. Su número de parámetros es menor que el de muchos modelos contemporáneos, como los 175 mil millones de parámetros de GPT-3, pero logra un rendimiento competitivo en un rango más estrecho de tareas debido a su entrenamiento especializado.
Limitaciones y Direcciones Futuras
A pesar de su versatilidad, Gato 1.2B tiene limitaciones. Le cuesta manejar tareas de horizonte largo y requiere una tokenización cuidadosa de imágenes y acciones. Su rendimiento se degrada en tareas fuera de su distribución de entrenamiento. Los investigadores de DeepMind han explorado escalar el modelo e incorporar datos más diversos para mejorar la generalización. El modelo también plantea preguntas sobre seguridad y control, ya que puede usarse para aplicaciones tanto beneficiosas como dañinas. El trabajo futuro incluye integrar aprendizaje por refuerzo con retroalimentación humana y aprendizaje curricular para mejorar sus capacidades.
Recepción e Impacto
Gato 1.2B fue bien recibido en la comunidad de aprendizaje automático por su ambicioso objetivo de un único agente para múltiples dominios. Provocó discusiones sobre el camino hacia la IA de propósito general y la importancia del entrenamiento multimodal. El código y los pesos del modelo no fueron completamente de código abierto, pero su arquitectura y detalles de entrenamiento se publicaron en un informe técnico. Ha influido en investigaciones posteriores sobre agentes generalistas, incluidos modelos posteriores de DeepMind como RT-2 y SIMA.