Traducido del inglés

Cerebras-GPT es una familia de modelos de lenguaje grandes óptimos en cómputo desarrollados por Cerebras Systems, entrenados utilizando la ley de escalado de Chinchilla en el sistema a escala de oblea CS-2. Publicado en 2023, incluye modelos desde 111M hasta 13B de parámetros, diseñados para un entrenamiento eficiente y disponibilidad de código abierto.

Cerebras-GPT es una familia de modelos de lenguaje grandes de código abierto desarrollada por Cerebras Systems, una empresa conocida por sus aceleradores de redes neuronales a escala de oblea. Los modelos fueron diseñados para lograr un rendimiento óptimo en términos de cómputo, lo que significa que se entrenaron para equilibrar el tamaño del modelo y el volumen de datos de entrenamiento según la ley de escalado de Chinchilla, que establece que, para un presupuesto de cómputo dado, los modelos más grandes con proporcionalmente más datos producen un mejor rendimiento. Cerebras-GPT se lanzó en marzo de 2023, con el objetivo de demostrar la eficiencia del sistema CS-2 de Cerebras para entrenar modelos de última generación a escala.

La familia incluye modelos con recuentos de parámetros que van desde 111 millones hasta 13 mil millones, específicamente: 111M, 256M, 590M, 1.3B, 2.7B, 6.7B y 13B. Todos los modelos se entrenaron con el mismo conjunto de datos público, el Pile, que es una colección diversa de texto de libros, artículos académicos y contenido web. El entrenamiento utilizó un presupuesto de cómputo fijo por modelo, siguiendo la proporción óptima de Chinchilla de aproximadamente 20 tokens por parámetro, asegurando que cada modelo se entrenara con la cantidad adecuada de datos para maximizar su rendimiento según su tamaño. Los modelos se entrenaron utilizando el optimizador Adam con un programa de tasa de aprendizaje coseno y recorte de gradientes para estabilizar el entrenamiento.

Arquitectura y Entrenamiento

Los modelos Cerebras-GPT utilizan la arquitectura Transformer estándar, específicamente la variante solo de decodificador, que es común para modelos de lenguaje generativos. Cada modelo emplea atención de múltiples cabezas, normalización de capas y incrustaciones posicionales aprendidas. Los modelos se entrenaron en el sistema CS-2, que integra una sola oblea de silicio con más de 850,000 núcleos, lo que permite un entrenamiento de alto rendimiento sin necesidad de entrenamiento distribuido en múltiples GPU. Esta arquitectura permitió a Cerebras entrenar los modelos en una fracción del tiempo y la energía en comparación con los clústeres de GPU tradicionales, ya que el diseño a escala de oblea reduce la sobrecarga de comunicación.

El entrenamiento se realizó en precisión bfloat16, y los modelos se entrenaron desde cero sin puntos de control preexistentes. El proceso de entrenamiento utilizó un tamaño de lote de 256 secuencias, cada una con una longitud de 2048 tokens, y el total de tokens de entrenamiento para cada modelo se determinó mediante la fórmula de Chinchilla. Por ejemplo, el modelo de 13B se entrenó con aproximadamente 260 mil millones de tokens, mientras que el modelo de 111M se entrenó con alrededor de 2.2 mil millones de tokens. Los datos de entrenamiento se barajaron y procesaron para garantizar la diversidad, y los modelos se evaluaron en puntos de referencia estándar como la perplejidad de modelado de lenguaje y tareas posteriores.

Rendimiento y Puntos de Referencia

Los modelos Cerebras-GPT se evaluaron en varios puntos de referencia, incluidos LAMBADA, HellaSwag y Winogrande, que prueban la comprensión y el razonamiento del lenguaje. Los resultados mostraron que los modelos se desempeñaron de manera competitiva con otros modelos de código abierto de tamaño similar, como los de OpenAI y Anthropic, a pesar de haber sido entrenados con una receta más simple. Por ejemplo, el modelo de 13B logró una precisión LAMBADA del 72.3%, que es comparable a otros modelos de 13B disponibles en ese momento. Los modelos también demostraron un rendimiento sólido en el conjunto de validación reservado del Pile, con una perplejidad que disminuía a medida que aumentaba el tamaño del modelo, como se esperaba.

Un aspecto notable de Cerebras-GPT es su enfoque en la eficiencia de cómputo. La empresa informó que entrenar el modelo de 13B en el CS-2 tomó aproximadamente 10 días, mientras que una ejecución de entrenamiento comparable en un clúster de 512 GPU NVIDIA A100 tomaría alrededor de 30 días. Esta eficiencia se atribuye al diseño a escala de oblea, que elimina la necesidad de paralelismo de modelos y reduce la comunicación entre chips. Los modelos se lanzaron bajo la licencia Apache 2.0, lo que permite un uso y modificación sin restricciones, un movimiento deliberado para promover la investigación y el desarrollo en la comunidad de código abierto.

Comparación con Otros Modelos

En el momento del lanzamiento, Cerebras-GPT se destacó entre los modelos de código abierto por su adherencia a la ley de escalado de Chinchilla. Muchos modelos anteriores, como GPT-3, se entrenaron con más datos de los óptimos en términos de cómputo, lo que llevó a ineficiencias. Cerebras-GPT fue una de las primeras familias en seguir explícitamente el enfoque óptimo en términos de cómputo, lo que significaba que cada modelo se entrenaba con exactamente la cantidad correcta de datos para su recuento de parámetros. Este enfoque se validó por el hecho de que los modelos lograron un rendimiento comparable o mejor que los modelos entrenados con proporciones subóptimas de datos a parámetros.

En comparación con modelos posteriores como LLaMA (que se lanzó más tarde en 2023), Cerebras-GPT era más pequeño en tamaño máximo, pero ofrecía un estudio más sistemático del escalado. Los modelos también fueron notables por su reproducibilidad, ya que el código de entrenamiento y las configuraciones se abrieron, lo que permitió a los investigadores replicar los resultados. Sin embargo, los modelos no fueron ajustados con instrucciones ni afinados para chat, por lo que estaban destinados principalmente a la investigación sobre leyes de escalado y entrenamiento eficiente, más que a la implementación en aplicaciones.

Impacto y Legado

Cerebras-GPT contribuyó a la tendencia más amplia de democratizar los modelos de lenguaje grandes al proporcionar una familia de modelos que podían ejecutarse en hardware modesto. El modelo más pequeño (111M) podía afinarse en una sola GPU, mientras que el más grande (13B) requería una configuración de múltiples GPU, pero seguía siendo accesible para muchos laboratorios de investigación. El lanzamiento también destacó el potencial de arquitecturas de hardware alternativas, como la integración a escala de oblea, para reducir el costo y la huella energética del entrenamiento de modelos grandes.

Los modelos se utilizaron en investigaciones posteriores sobre técnicas de aprendizaje curricular y aumento de datos, ya que su naturaleza de código abierto permitía una experimentación fácil. Cerebras Systems continuó desarrollando modelos más grandes, como las variantes Cerebras-GPT 7B y más tarde Cerebras-GPT 13B, pero la familia original sigue siendo un punto de referencia para el entrenamiento óptimo en términos de cómputo. La empresa también utilizó la experiencia para informar el desarrollo de su hardware de próxima generación, el CS-3, que se anunció en 2024.

Disponibilidad y Uso

Los modelos Cerebras-GPT están disponibles en Hugging Face y a través del Cerebras Model Zoo, que proporciona puntos de control preentrenados y scripts de inferencia. Los modelos se pueden usar con frameworks de aprendizaje automático estándar como PyTorch, y el código de entrenamiento está disponible en GitHub. La licencia Apache 2.0 permite el uso comercial, lo que hace que los modelos sean atractivos para startups y empresas que buscan implementar modelos de lenguaje sin tarifas de licencia. Sin embargo, los usuarios deben ser conscientes de que los modelos no fueron alineados con las preferencias humanas, por lo que pueden producir resultados sesgados o dañinos, y se recomiendan salvaguardas apropiadas para la implementación.

En resumen, Cerebras-GPT es una contribución significativa al campo de la inteligencia artificial, demostrando que el entrenamiento óptimo en términos de cómputo es alcanzable con hardware especializado y proporcionando un recurso valioso para investigadores que estudian leyes de escalado y eficiencia de modelos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-models·open-source-ai·scaling-laws·wafer-scale-computing
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial