Chinchilla es una familia de modelos de lenguaje de gran tamaño (LLM) desarrollada por el equipo de investigación de Google DeepMind, presentada en marzo de 2022. La familia fue diseñada para investigar las leyes de escalado de los modelos de lenguaje, basándose en trabajos anteriores con la familia de modelos Gopher. Los modelos Chinchilla se basan en la arquitectura de transformador y se entrenaron para lograr un mejor rendimiento bajo presupuestos computacionales fijos, lo que condujo a una recomendación ampliamente citada para entrenar modelos grandes de manera eficiente.
El nombre "Chinchilla" refleja su papel como un desarrollo posterior a la familia de modelos Gopher. Ambas familias se entrenaron para explorar cómo interactúan el tamaño del modelo y la cantidad de datos de entrenamiento. Chinchilla afirmó superar a GPT-3 utilizando significativamente menos parámetros, lo que simplificó su uso al requerir menos potencia computacional para la inferencia y el ajuste fino.
Leyes de escalado y entrenamiento
El hallazgo central de la investigación de Chinchilla fue que, para un presupuesto computacional dado, el tamaño del modelo y la cantidad de tokens de entrenamiento deben escalarse proporcionalmente. Específicamente, si se duplica el tamaño del modelo, la cantidad de tokens de entrenamiento también debe duplicarse. Este principio se derivó del análisis del entrenamiento de modelos de lenguaje utilizados anteriormente. DeepMind utilizó esta hipótesis para entrenar a Chinchilla, que tiene 70 mil millones de parámetros y se entrenó con 1,4 billones de tokens, cuatro veces más datos que los 300 mil millones de tokens de Gopher, con un costo computacional similar.
Este enfoque óptimo en términos computacionales contrasta con prácticas anteriores que a menudo priorizaban aumentar únicamente los parámetros del modelo. El equipo de Chinchilla recomendó que el uso de conjuntos de datos de entrenamiento más grandes y de mayor calidad puede conducir a mejores resultados en tareas posteriores, incluso sin aumentar el tamaño del modelo. Estas conclusiones han influido en las metodologías de entrenamiento posteriores en el campo de la inteligencia artificial.
Rendimiento y benchmarks
Chinchilla logró una precisión promedio del 67,5 % en el benchmark Measuring Massive Multitask Language Understanding (MMLU), un 7 % más que Gopher. Esta mejora fue notable dado que Gopher tenía 280 mil millones de parámetros, cuatro veces más que Chinchilla. La eficiencia del modelo lo hizo práctico para una gama más amplia de aplicaciones, ya que requería menos cómputo tanto para la inferencia como para el ajuste fino.
Hasta el 12 de enero de 2023, Chinchilla se encontraba aún en fase de pruebas, lo que indicaba que sus capacidades y limitaciones completas estaban siendo evaluadas. El éxito del modelo en benchmarks como MMLU demostró que un entrenamiento óptimo en términos computacionales podía producir resultados competitivos o superiores en comparación con modelos más grandes entrenados con menos datos.
Arquitectura
Tanto la familia Gopher como la familia Chinchilla son familias de modelos transformadores. Son esencialmente iguales a GPT-2, con diferentes tamaños y modificaciones menores. La familia Gopher utiliza RMSNorm en lugar de LayerNorm y codificación posicional relativa en lugar de codificación posicional absoluta. La familia Chinchilla es idéntica a la familia Gopher, pero se entrena con el optimizador AdamW en lugar del optimizador Adam.
La familia Gopher contiene seis modelos de tamaño creciente, desde 44 millones de parámetros hasta 280 mil millones de parámetros, siendo el más grande denominado "Gopher". Convenciones de nomenclatura similares se aplican a la familia Chinchilla, que incluye modelos de varios tamaños, siendo la versión de 70 mil millones de parámetros la más destacada. La Tabla 1 del artículo original detalla toda la familia Gopher, mientras que la Tabla 4 compara a Chinchilla de 70 mil millones de parámetros con Gopher de 280 mil millones.
Aplicaciones e influencia
Chinchilla se ha utilizado como base para otros modelos, incluido el modelo de visión-lenguaje Flamingo, que integra el procesamiento visual y textual. Las leyes de escalado establecidas por Chinchilla se han convertido en una referencia estándar en el campo del aprendizaje automático, guiando las decisiones sobre el tamaño del modelo y el tamaño del conjunto de datos en desarrollos posteriores de LLM.
La investigación contribuyó a desarrollar un paradigma de entrenamiento eficaz para modelos de lenguaje autorregresivos grandes con recursos computacionales limitados. Al demostrar que la cantidad de datos es tan importante como el tamaño del modelo, Chinchilla desplazó el enfoque hacia la calidad y la curación de los conjuntos de datos. Esto ha tenido un impacto duradero en cómo organizaciones como OpenAI y Anthropic abordan el entrenamiento de modelos, aunque los detalles específicos de sus prácticas internas no siempre son públicos.
Véase también
- Gopher
- Leyes de escalado
- Aprendizaje profundo