Chinchilla 70B es un modelo de lenguaje de gran escala desarrollado por Google DeepMind, presentado en 2022. Es la variante de 70 mil millones de parámetros de la familia de modelos Chinchilla, diseñados para probar y validar leyes de escalado para entrenar redes neuronales eficientes en cómputo. El modelo fue un artefacto central en un artículo de investigación que argumentaba un equilibrio diferente entre el tamaño del modelo y los datos de entrenamiento en comparación con lo común en ese momento, influyendo en trabajos posteriores en modelos de lenguaje de gran escala e investigación en aprendizaje automático.
El proyecto Chinchilla se motivó por la observación de que muchos modelos de lenguaje de gran escala contemporáneos, incluido GPT-3 de OpenAI, se entrenaban con muchos menos tokens de lo óptimo dado su número de parámetros. Los investigadores propusieron que, para un presupuesto de cómputo fijo, el mejor rendimiento proviene de escalar el tamaño del modelo y los datos de entrenamiento aproximadamente por igual, en lugar de favorecer uno sobre el otro. Chinchilla 70B se entrenó con aproximadamente 1,4 billones de tokens, un conjunto de datos sustancialmente mayor en relación con su tamaño que muchos predecesores, y superó a modelos mucho más grandes en una variedad de puntos de referencia.
Arquitectura y Entrenamiento
Chinchilla 70B utiliza una arquitectura Transformer estándar, similar a otros modelos de lenguaje de gran escala de su época. Emplea atención de múltiples cabezas y codificaciones posicionales, con una estructura solo de decodificador. El modelo se entrenó usando el optimizador Adam con un programa de tasa de aprendizaje que incluía calentamiento y decaimiento coseno. Se aplicó recorte de gradientes para estabilizar el entrenamiento.
El conjunto de datos de entrenamiento comprendía un subconjunto filtrado y deduplicado de texto web público, libros y otras fuentes, totalizando alrededor de 1,4 billones de tokens. Esto fue una elección deliberada para probar la hipótesis de que más datos, en lugar de más parámetros, podrían producir un mejor rendimiento para un presupuesto de cómputo dado. El entrenamiento utilizó un gran clúster de TPUs, aprovechando la infraestructura de Google Cloud.
Leyes de Escalado y Significado
La contribución principal de Chinchilla 70B fue evidencia empírica para leyes de escalado óptimas en cómputo. El equipo de investigación, incluidos Jordan Hoffmann y otros, analizó la relación entre el tamaño del modelo, el tamaño del conjunto de datos y el presupuesto de cómputo. Encontraron que, para un presupuesto de cómputo dado, el tamaño óptimo del modelo es mucho menor de lo que se suponía anteriormente, y el número óptimo de tokens de entrenamiento es mucho mayor. Este resultado, a menudo referido como la "ley de escalado de Chinchilla", sugería que muchos modelos existentes estaban sobre-parametrizados y sub-entrenados.
Chinchilla 70B, a pesar de tener menos parámetros que modelos como GPT-3 (175B) y Gopher (280B), logró un rendimiento superior en muchos puntos de referencia de inteligencia artificial, incluidos modelado de lenguaje, comprensión lectora y tareas de razonamiento. Esto demostró que la eficiencia del entrenamiento podría ser más importante que el recuento bruto de parámetros.
Rendimiento y Puntos de Referencia
En un conjunto de puntos de referencia estándar, Chinchilla 70B superó a Gopher (280B parámetros) y GPT-3 (175B parámetros) en la mayoría de las tareas. Por ejemplo, logró una mayor precisión en MMLU (Comprensión Multitarea Masiva de Lenguaje) y mejoró los resultados en conjuntos de datos de respuesta a preguntas y razonamiento de sentido común. El modelo también mostró un fuerte rendimiento en tareas de razonamiento matemático y científico, aunque aún tenía limitaciones comunes a los modelos de lenguaje de la época, como errores factuales y sensibilidad a la redacción de las indicaciones.
El rendimiento del modelo fue particularmente notable en el contexto del desarrollo de IA generativa, ya que mostró que modelos más pequeños y mejor entrenados podrían ser más prácticos y rentables. Esto influyó en el desarrollo posterior de modelos en Anthropic, OpenAI y otras organizaciones, que comenzaron a prestar más atención al volumen de datos de entrenamiento.
Impacto y Legado
Las leyes de escalado de Chinchilla tuvieron un impacto significativo en el campo del aprendizaje profundo. Impulsaron un cambio en cómo los investigadores y las empresas asignan recursos de cómputo, enfatizando la importancia de conjuntos de datos grandes y de alta calidad. Los hallazgos también informaron decisiones sobre arquitectura de modelos y presupuestos de entrenamiento en modelos posteriores, como LLaMA y otros, que adoptaron proporciones similares de datos a parámetros.
Chinchilla 70B en sí no se lanzó como un modelo de pesos abiertos, pero sus hallazgos de investigación se difundieron ampliamente e influyeron en esfuerzos posteriores de código abierto. La arquitectura y el enfoque de entrenamiento del modelo se convirtieron en un punto de referencia para la investigación académica e industrial, y el análisis de leyes de escalado sigue siendo una referencia fundamental en el campo.
Recepción y Crítica
Si bien los resultados de Chinchilla fueron ampliamente elogiados, algunos investigadores señalaron que el análisis de leyes de escalado se basaba en un conjunto limitado de tamaños de modelo y presupuestos de cómputo, y que la proporción óptima podría variar con diferentes arquitecturas o distribuciones de datos. Trabajos posteriores han refinado estas leyes, pero la idea central - que el volumen de datos de entrenamiento es tan importante como el tamaño del modelo - ha sido ampliamente aceptada.
Algunos también señalaron que el enfoque óptimo en cómputo no necesariamente conduce al mejor rendimiento para un presupuesto de inferencia dado, ya que los modelos más grandes pueden ser más eficientes en inferencia incluso si son menos eficientes de entrenar. Este matiz llevó a una exploración continua del escalado de modelos en diferentes direcciones, incluidas arquitecturas de mezcla de expertos y otras técnicas de eficiencia.