Traducido del inglés

Llama 3 es una familia de modelos de lenguaje de gran tamaño de pesos abiertos lanzada por Meta AI en abril de 2024, disponible en tamaños de 8B y 70B parámetros, entrenada con 15 billones de tokens, y diseñada tanto para uso fundacional como ajustado por instrucciones.

Llama 3 es una familia de modelos de lenguaje de gran tamaño desarrollada por Meta AI y publicada el 18 de abril de 2024. Forma parte de la serie Llama, que comenzó en febrero de 2023, y representa un avance significativo en el rendimiento de los modelos de peso abierto. La publicación inicial incluyó dos tamaños de modelo: 8 mil millones (8B) y 70 mil millones (70B) de parámetros, con versiones tanto de base como ajustadas por instrucciones. Los modelos Llama 3 se preentrenaron con aproximadamente 15 billones de tokens de texto de fuentes disponibles públicamente, y las variantes ajustadas por instrucciones se refinaron además con conjuntos de datos de instrucciones públicas y más de 10 millones de ejemplos anotados por humanos.

Llama 3 se basa en los principios arquitectónicos de sus predecesores, pero introduce mejoras notables en la escala de los datos de entrenamiento y en el rendimiento. Según las pruebas de Meta AI en abril de 2024, el modelo de 70B superó a modelos competidores como Gemini Pro 1.5 y Claude 3 Sonnet en la mayoría de los puntos de referencia. La publicación también marcó el despliegue de Meta AI, un asistente de IA basado en Llama, disponible a través de un sitio web dedicado e integrado en Facebook y WhatsApp.

Antecedentes

El desarrollo de Llama 3 se produjo en un contexto de rápido progreso en la IA generativa, especialmente tras la publicación de ChatGPT a finales de 2022. El éxito de ChatGPT intensificó el interés en los modelos de lenguaje de gran tamaño, lo que llevó a las empresas a invertir fuertemente en escalar y refinar estos sistemas. El científico jefe de IA de Meta, Yann LeCun, había expresado anteriormente que los modelos de lenguaje de gran tamaño son los más adecuados para ayudar en la escritura, una perspectiva que influyó en el diseño de los modelos Llama.

Llama 3 también refleja un cambio en el enfoque de Meta hacia la distribución de modelos. Mientras que el Llama original estaba restringido a investigadores académicos bajo una licencia no comercial, las versiones posteriores, incluida Llama 3, se hicieron accesibles a un público más amplio bajo licencias que permiten cierto uso comercial. Esta apertura ha estimulado la innovación, pero también ha suscitado debates sobre la definición de "código abierto" en la comunidad de IA.

Arquitectura y Entrenamiento

Los modelos Llama 3 utilizan una arquitectura Transformer (architecture) estándar, similar a las versiones anteriores de Llama, pero con mejoras en la metodología de entrenamiento. Los modelos se entrenaron con un conjunto de datos de 15 billones de tokens, un aumento sustancial respecto a los 1.4 billones de tokens utilizados para Llama 2. Esta escala permitió que los modelos lograran un mejor rendimiento en una amplia gama de tareas.

Un hallazgo clave del entrenamiento de Llama 3 se relacionó con las leyes de escalado. Los modelos demostraron empíricamente que el rendimiento continúa mejorando de manera log-lineal incluso cuando los datos de entrenamiento superan la cantidad "óptima de Chinchilla". Por ejemplo, el conjunto de datos óptimo de Chinchilla para el modelo de 8B es de 200 mil millones de tokens, pero el rendimiento siguió escalando hasta los 15 billones de tokens utilizados, que es 75 veces mayor. Esta observación tiene implicaciones para las futuras estrategias de entrenamiento de modelos.

Durante una entrevista con Dwarkesh Patel, el CEO de Meta, Mark Zuckerberg, señaló que la versión de 8B de Llama 3 era casi tan potente como el modelo más grande de Llama 2. También mencionó que el modelo de 70B todavía estaba aprendiendo al final de su entrenamiento de 15 billones de tokens, pero se tomó la decisión de detener el entrenamiento para asignar recursos de GPU a otros fines.

Rendimiento y Puntos de Referencia

Los modelos Llama 3 lograron resultados de última generación en muchos puntos de referencia de procesamiento de lenguaje natural en el momento de su publicación. El modelo de 70B, en particular, superó a varios modelos propietarios, incluidos Gemini Pro 1.5 y Claude 3 Sonnet, en tareas como razonamiento, codificación y conocimiento general. El modelo de 8B, a pesar de su menor tamaño, ofreció un rendimiento competitivo, lo que lo hace adecuado para su implementación en hardware menos potente.

La evaluación de Meta AI mostró que Llama 3 70B destacó en áreas como el razonamiento matemático y la generación de código, mientras que el modelo de 8B ofreció un equilibrio sólido entre eficiencia y capacidad. Estos resultados posicionaron a Llama 3 como un modelo de peso abierto líder, desafiando el dominio de los sistemas de código cerrado.

Disponibilidad y Ecosistema

Llama 3 se publicó bajo una licencia que permite el uso comercial, con una política de uso aceptable que restringe ciertas aplicaciones. Los modelos están disponibles para su descarga en el sitio web de Meta y a través de varias plataformas en la nube, incluidas Amazon Web Services, Azure y Google Cloud. Esta accesibilidad ha facilitado una adopción generalizada en la investigación y la industria.

La publicación de Llama 3 también coincidió con el lanzamiento de Meta AI, un asistente que aprovecha las capacidades del modelo. Meta AI está integrado en Facebook, WhatsApp y un sitio web dedicado, proporcionando a los usuarios servicios de IA conversacional. El ecosistema en torno a Llama 3 incluye herramientas para el ajuste fino, la cuantización y la implementación, lo que permite a los desarrolladores personalizar los modelos para casos de uso específicos.

Legado y Futuro

Llama 3 marcó un hito en la evolución de los modelos de lenguaje de gran tamaño de peso abierto, demostrando que dichos modelos podían rivalizar con sus contrapartes propietarias. Su éxito influyó en desarrollos posteriores, incluido Llama 3.1, publicado el 23 de julio de 2024, que introdujo mejoras adicionales. La serie Llama continuó con Llama 4 en abril de 2025, y en abril de 2026, Meta Superintelligence Labs publicó Muse Spark como reemplazo de Llama.

El impacto de Llama 3 se extiende más allá de los logros técnicos, ya que contribuyó a los debates sobre la seguridad de la IA, la accesibilidad y la democratización de las tecnologías avanzadas de IA. Su naturaleza de peso abierto ha permitido que investigadores y desarrolladores de todo el mundo experimenten y construyan sobre el modelo, fomentando un ecosistema vibrante de innovación.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-models·meta-ai·open-source-ai·generative-ai
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial