Gopher es una familia de modelos de lenguaje de gran tamaño desarrollada por el equipo de investigación de Google DeepMind. La familia consta de seis modelos basados en transformadores de tamaño creciente, que van desde 44 millones de parámetros hasta 280 mil millones de parámetros, siendo el modelo más grande denominado "Gopher" por defecto. Gopher se presentó a finales de 2021 y se entrenó para investigar las leyes de escalado de los modelos de lenguaje de gran tamaño, sentando las bases para la posterior familia de modelos Chinchilla, introducida en marzo de 2022.
La familia Gopher se diseñó como parte de un esfuerzo de investigación más amplio sobre cómo el rendimiento del modelo escala con los parámetros y los datos de entrenamiento. Los modelos son esencialmente la misma arquitectura que GPT-2, con modificaciones menores, incluido el uso de RMSNorm en lugar de LayerNorm y codificación posicional relativa en lugar de codificación posicional absoluta. El modelo Gopher más grande, con 280 mil millones de parámetros, se entrenó con aproximadamente 300 mil millones de tokens.
Leyes de Escalado y Entrenamiento
El desarrollo de Gopher estuvo motivado por la cuestión de cómo asignar de manera óptima los recursos computacionales al entrenar modelos de lenguaje de gran tamaño. Antes de Gopher, muchos modelos, incluido el GPT-3 de OpenAI, se entrenaban con un enfoque en aumentar el tamaño del modelo mientras se mantenía relativamente fijo el conjunto de datos de entrenamiento. Sin embargo, el equipo de investigación de Gopher descubrió mediante estudios empíricos que, para un presupuesto computacional dado, el tamaño óptimo del modelo y el número de tokens de entrenamiento siguen una relación específica: si se duplica el tamaño del modelo, el número de tokens de entrenamiento también debería duplicarse. Este hallazgo, formalizado posteriormente en el artículo de Chinchilla, sugería que muchos modelos existentes estaban subentrenados.
El entrenamiento de Gopher utilizó un gran corpus de datos de texto, y el modelo demostró un rendimiento sólido en una variedad de puntos de referencia de procesamiento de lenguaje natural. Sin embargo, su rendimiento en el punto de referencia de Medición de Comprensión Multitarea Masiva de Lenguaje (MMLU) fue de un 60,5% de precisión promedio, una cifra que más tarde sería superada por su sucesor Chinchilla.
Arquitectura y Variantes
La familia Gopher incluye seis modelos con recuentos de parámetros de 44 millones, 117 millones, 417 millones, 1.4 mil millones, 7.1 mil millones y 280 mil millones. Todos los modelos comparten la misma arquitectura central basada en la arquitectura transformador, específicamente similar a GPT-2 pero con las modificaciones señaladas. El uso de RMSNorm, una variante de la normalización de capas que es computacionalmente más eficiente, y la codificación posicional relativa, que puede mejorar la generalización a secuencias más largas, fueron diferencias clave con respecto a los modelos de transformadores anteriores.
El modelo Gopher más grande se entrenó utilizando una configuración de entrenamiento distribuido, aprovechando miles de aceleradores. El proceso de entrenamiento fue intensivo en recursos, y el modelo requirió una potencia computacional significativa tanto para la inferencia como para el ajuste fino, una limitación que motivó el desarrollo posterior de Chinchilla.
Rendimiento y Evaluación
Gopher se evaluó en una variedad de puntos de referencia, incluidos el modelado de lenguaje, la comprensión lectora y la respuesta a preguntas. Mostró capacidades sólidas en muchas áreas, pero su rendimiento no fue uniformemente superior al de modelos más pequeños en todas las tareas. Por ejemplo, en algunas tareas de razonamiento y de uso intensivo de conocimiento, Gopher se desempeñó bien, pero también mostró limitaciones en áreas como la consistencia factual y el razonamiento de sentido común.
En comparación con GPT-3, Gopher logró resultados competitivos o mejores en varios puntos de referencia, pero las diferencias no siempre fueron drásticas. El equipo de investigación señaló que las ganancias de rendimiento de Gopher a menudo eran modestas en relación con el gran aumento en el tamaño del modelo, lo que destacó aún más la importancia del escalado de los datos de entrenamiento.
Legado y Sucesor
El principal legado de Gopher es su contribución a la comprensión de las leyes de escalado en los modelos de lenguaje. Los conocimientos obtenidos al entrenar Gopher informaron directamente el diseño de Chinchilla, una familia de modelos con 70 mil millones de parámetros entrenada con 1.4 billones de tokens. Chinchilla, que se presentó en marzo de 2022, logró una precisión promedio más alta (67,5% en MMLU) que Gopher mientras usaba un presupuesto computacional similar, lo que demostró que las recomendaciones de las leyes de escalado eran efectivas.
La familia Chinchilla comparte la misma arquitectura que Gopher, pero se entrenó con el optimizador AdamW en lugar de Adam. Gopher también sirvió como base para otros modelos, como el modelo de visión-lenguaje Flamingo, que utilizó componentes de la familia Gopher. A partir de enero de 2023, Chinchilla todavía estaba en fase de pruebas, mientras que Gopher había sido superado por su sucesor más eficiente.