Meta lanzó Llama 3, una familia de modelos de lenguaje de gran tamaño (LLM), el 18 de abril de 2024, como parte de su serie Llama en curso. El lanzamiento incluyó dos tamaños de modelo: 8 mil millones y 70 mil millones de parámetros, ambos preentrenados con aproximadamente 15 billones de tokens de texto de fuentes públicas. Las variantes ajustadas por instrucciones se refinaron con conjuntos de datos de instrucciones públicos y más de 10 millones de ejemplos anotados por humanos. Meta posicionó Llama 3 como un paso significativo en la IA de pesos abiertos, con el modelo de 70B superando a varios rivales comerciales en puntos de referencia estándar en el momento del lanzamiento.
La serie Llama comenzó en febrero de 2023 con Llama 1, inicialmente lanzado solo a investigadores bajo una licencia no comercial. Tras una filtración no autorizada a través de BitTorrent en marzo de 2023, Meta cambió su estrategia con Llama 2 en julio de 2023, ofreciendo pesos para un uso comercial más amplio bajo una licencia personalizada. Llama 3 continuó esta trayectoria, enfatizando la accesibilidad y el rendimiento. El lanzamiento coincidió con Meta AI, un asistente basado en Llama, disponible a través de un sitio web dedicado e integrado en Facebook y WhatsApp.
Arquitectura del modelo y entrenamiento
Los modelos Llama 3 utilizan una arquitectura de transformador estándar con mejoras sobre versiones anteriores. Los modelos de 8B y 70B se entrenaron con 15 billones de tokens, un conjunto de datos 75 veces mayor que la cantidad óptima de Chinchilla para el tamaño de 8B (200 mil millones de tokens). A pesar de superar el punto óptimo de datos, el rendimiento continuó escalando de manera log-lineal, desafiando las leyes de escalado convencionales. Meta informó que el modelo de 70B aún mejoraba al final del entrenamiento, pero el equipo optó por detenerse para asignar recursos de GPU a otros lugares.
Los datos de entrenamiento se seleccionaron de fuentes públicas, con énfasis en calidad y diversidad. El ajuste fino por instrucciones utilizó una combinación de conjuntos de datos públicos y ejemplos anotados por humanos, mejorando la capacidad de los modelos para seguir instrucciones complejas. Meta también anunció planes para hacer que las versiones futuras sean multilingües, multimodales y mejores en codificación y razonamiento, con una ventana de contexto ampliada.
Rendimiento y puntos de referencia
En abril de 2024, las pruebas internas de Meta mostraron que Llama 3 70B superaba a Gemini Pro 1.5 y Claude 3 Sonnet en la mayoría de los puntos de referencia, incluidas tareas de razonamiento, codificación y conocimiento general. Mark Zuckerberg informó que el modelo de 8B era casi tan potente como el modelo más grande de Llama 2 (70B), demostrando ganancias de eficiencia significativas. Estos resultados posicionaron a Llama 3 como una alternativa competitiva a los modelos propietarios de empresas como OpenAI, Anthropic y Google DeepMind.
Los modelos se evaluaron en puntos de referencia estándar de PNL, con la variante de 70B logrando resultados de vanguardia entre los modelos de pesos abiertos en ese momento. El comportamiento de escalado observado - mejora continua más allá de los datos óptimos de Chinchilla - sugirió que conjuntos de datos más grandes podrían generar ganancias adicionales, influyendo en investigaciones posteriores en aprendizaje automático y aprendizaje profundo.
Lanzamiento y ecosistema
Llama 3 se lanzó bajo una licencia personalizada que permite el uso comercial, aunque con una política de uso aceptable que restringía ciertas aplicaciones, lo que generó debates sobre si calificaba como código abierto. Los pesos se pusieron a disposición para descarga, y los modelos se integraron en varias plataformas, incluidas Amazon Web Services, Microsoft Azure, Google Cloud y Oracle Cloud Infrastructure. Proveedores de hardware especializado como Groq y SambaNova optimizaron la inferencia para Llama 3, permitiendo un despliegue más rápido.
El lanzamiento impulsó una ola de variantes y herramientas ajustadas, similar al ecosistema que surgió alrededor de Llama 2. Los desarrolladores utilizaron técnicas como Reinforcement Learning from AI Feedback (RLAIF) y aprendizaje curricular para adaptar los modelos a dominios específicos. El enfoque de pesos abiertos contrastó con los modelos cerrados de los competidores, fomentando la innovación en aplicaciones de IA generativa.
Desarrollos posteriores
Llama 3.1 se lanzó el 23 de julio de 2024, introduciendo un modelo de 405B parámetros y ampliando la ventana de contexto. Esta versión consolidó aún más la posición de Llama en el panorama de la IA. La serie continuó con Llama 4 en abril de 2025, y en abril de 2026, Meta Superintelligence Labs lanzó Muse Spark como reemplazo. La evolución de Llama influyó en el campo más amplio, con investigadores estudiando leyes de escalado y eficiencia de entrenamiento, como se observa en trabajos sobre arquitecturas de transformador y funciones de pérdida.
El lanzamiento también destacó el papel de la computación a gran escala, con Meta aprovechando asociaciones con fabricantes de chips como AMD, Intel y TSMC para entrenar modelos de manera eficiente. El éxito de Llama 3 contribuyó a discusiones sobre el futuro de la inteligencia artificial y el equilibrio entre el desarrollo abierto y propietario.