Gato es un sistema de inteligencia artificial de propósito general desarrollado por Google DeepMind, anunciado por primera vez en 2022. Es una red neuronal única entrenada para realizar 604 tareas distintas que abarcan generación de texto, reconocimiento de imágenes, control robótico y juegos. El diseño de Gato se basa en la arquitectura Transformer (architecture), el mismo fundamento utilizado en los modelos de lenguaje grandes, pero se extiende para manejar entradas y salidas multimodales, incluyendo texto, imágenes y señales de control continuas.
El sistema se presentó como una demostración de que un solo modelo, sin ajuste fino específico para cada tarea, podía lograr un rendimiento competente en una amplia gama de dominios. Aunque no superaba a los sistemas especializados en todas las tareas, Gato destacó el potencial de los agentes generalistas en la investigación de IA, alineándose con esfuerzos más amplios hacia modelos más flexibles y adaptables.
Arquitectura y Entrenamiento
La arquitectura de Gato es un modelo de secuencia basado en transformer que procesa tokens de diferentes modalidades. Las entradas, como imágenes, pasan por un codificador visual, mientras que el texto y las acciones discretas se tokenizan directamente. Las salidas de control continuo, como los pares de torsión de las articulaciones de robots, se discretizan en intervalos. El modelo se entrena utilizando un objetivo estándar de aprendizaje automático - predecir el siguiente token en una secuencia - en todos los tipos de tareas.
Los datos de entrenamiento provinieron de diversas fuentes, incluyendo corpus de texto, conjuntos de datos de imágenes, grabaciones de juegos y demostraciones de manipulación robótica en el mundo real. El modelo tiene aproximadamente 1.2 mil millones de parámetros, lo que lo hace relativamente pequeño en comparación con los modelos de lenguaje grandes contemporáneos. El entrenamiento utilizó un solo pod TPUv3, lo que refleja eficiencia en el uso de datos y cómputo.
Capacidades y Tareas
Gato fue evaluado en 604 tareas, que cubren categorías como:
- Tareas de texto: responder preguntas, resumir y generar diálogos.
- Tareas de visión: subtitulado de imágenes y reconocimiento de objetos.
- Juegos: juegos de Atari y el entorno de ajedrez, logrando un rendimiento a nivel amateur.
- Robótica: controlar un brazo robótico real para apilar bloques y manipular objetos.
El modelo demostró transferencia positiva, lo que significa que entrenar en un conjunto de tareas mejoró el rendimiento en otras. Por ejemplo, la exposición a datos de texto e imágenes ayudó con las tareas de control robótico, sugiriendo que las representaciones compartidas entre modalidades son beneficiosas.
Importancia y Recepción
Gato fue notable por su amplitud más que por su profundidad. Alcanzó o superó el 50% del rendimiento experto en la mayoría de las tareas, un punto de referencia que los investigadores utilizaron para medir la capacidad generalista. El sistema se consideró un paso hacia la inteligencia artificial general, aunque los expertos señalaron que carecía de la especialización profunda de los modelos dedicados.
Los críticos señalaron que el rendimiento de Gato en tareas individuales a menudo estaba por debajo de los sistemas de última generación, y que la noción de 'generalista' estaba limitada por el conjunto fijo de tareas. No obstante, influyó en investigaciones posteriores en IA generativa y aprendizaje multitarea, particularmente dentro de DeepMind y la comunidad de IA en general.
Relación con Otros Modelos
Gato comparte raíces conceptuales con los modelos de lenguaje grandes como los de OpenAI y Anthropic, pero difiere en su enfoque explícito en el control y la integración multimodal. A diferencia de los modelos de texto puro, Gato puede interactuar con entornos físicos y simulados, lo que lo acerca a los sistemas de IA encarnada. También se alinea con los esfuerzos en aprendizaje profundo para unificar tareas dispares bajo una sola arquitectura, una tendencia que continuó con modelos posteriores.
Legado y Direcciones Futuras
El lanzamiento de Gato provocó discusiones sobre el escalado de agentes generalistas. El trabajo posterior en el campo ha explorado modelos más grandes, conjuntos de tareas más diversos y técnicas de entrenamiento mejoradas. Aunque Gato en sí no se implementó comercialmente, sus principios influyeron en proyectos posteriores de DeepMind y contribuyeron al cambio más amplio hacia modelos fundacionales que manejan múltiples modalidades.
A partir de 2025, el concepto de un solo modelo que realiza cientos de tareas sigue siendo un área de investigación activa, con Gato sirviendo como una prueba de concepto temprana. Su legado radica en demostrar que las arquitecturas unificadas pueden lograr un rendimiento razonable en todos los dominios, allanando el camino para sistemas generalistas más capaces.