LLaMA (Large Language Model Meta AI, que funciona como un retroacrónimo) es una familia de modelos de lenguaje de gran tamaño (LLM) lanzados por Meta AI a partir de febrero de 2023. Los modelos vienen en varios tamaños, que van desde 1 mil millones hasta 2 billones de parámetros. Inicialmente lanzado como un modelo fundacional, a partir de Llama 2, Meta AI también lanzó versiones ajustadas con instrucciones junto con los modelos fundacionales. La versión más reciente es Llama 4, lanzada en abril de 2025. En abril de 2026, Meta Superintelligence Labs lanzó Muse Spark como reemplazo de Llama.
Antecedentes
Después del lanzamiento de modelos de lenguaje de gran tamaño como GPT-3, un enfoque de la investigación fue el escalado de modelos, que en algunos casos mostró aumentos importantes en capacidades emergentes. El lanzamiento de ChatGPT y su éxito sorprendente provocó un aumento en la atención hacia los modelos de lenguaje de gran tamaño. En comparación con otras respuestas a ChatGPT, el científico jefe de IA de Meta, Yann LeCun, declaró que los modelos de lenguaje de gran tamaño son los mejores para ayudar con la escritura.
Versiones
Lanzamiento inicial
La primera versión de Llama (estilizada como LLaMA y a veces referida como Llama 1) fue anunciada el 24 de febrero de 2023, mediante una publicación de blog y un artículo que describía el entrenamiento, la arquitectura y el rendimiento del modelo. El código de inferencia utilizado para ejecutar el modelo fue lanzado públicamente bajo la licencia de código abierto GPLv3. El acceso a los pesos del modelo se gestionaba mediante un proceso de solicitud, con acceso otorgado "caso por caso a investigadores académicos; aquellos afiliados a organizaciones en gobierno, sociedad civil y academia; y laboratorios de investigación industrial en todo el mundo".
Llama fue entrenado solo con información disponible públicamente, y se entrenó en varios tamaños de modelo, con la intención de hacerlo más accesible para diferentes hardware. El modelo era exclusivamente un modelo fundacional, aunque el artículo contenía ejemplos de versiones ajustadas con instrucciones del modelo. Meta AI informó que el rendimiento del modelo de 13 mil millones de parámetros en la mayoría de los puntos de referencia de PNL superaba al del mucho más grande GPT-3 (con 175 mil millones de parámetros), y que el modelo más grande de 65 mil millones era competitivo con modelos de última generación como PaLM y Chinchilla.
#### Fuga
El 3 de marzo de 2023, se subió un torrent que contenía los pesos de Llama, con un enlace al torrent compartido en el tablón de imágenes 4chan y posteriormente difundido en comunidades de IA en línea. Ese mismo día, se abrió una solicitud de extracción en el repositorio principal de Llama, solicitando agregar el enlace magnético a la documentación oficial. El 4 de marzo, se abrió una solicitud de extracción para agregar enlaces a repositorios de HuggingFace que contenían el modelo. El 6 de marzo, Meta presentó solicitudes de eliminación para retirar los repositorios de HuggingFace vinculados en la solicitud de extracción, caracterizándolo como "distribución no autorizada" del modelo. HuggingFace cumplió con las solicitudes. El 20 de marzo, Meta presentó una solicitud de eliminación DMCA por infracción de derechos de autor contra un repositorio que contenía un script que descargaba Llama desde un espejo, y GitHub cumplió al día siguiente.
Las reacciones a la fuga variaron. Algunos especularon que el modelo se usaría para fines maliciosos, como spam más sofisticado. Algunos celebraron la accesibilidad del modelo, así como el hecho de que las versiones más pequeñas del modelo pueden ejecutarse de manera relativamente económica, sugiriendo que esto promoverá el florecimiento de desarrollos de investigación adicionales. Múltiples comentaristas, como Simon Willison, compararon Llama con Stable Diffusion, un modelo de texto a imagen que, a diferencia de modelos comparativamente sofisticados que lo precedieron, fue distribuido abiertamente, lo que llevó a una rápida proliferación de herramientas, técnicas y software asociados.
Llama 2
El 18 de julio de 2023, en asociación con Microsoft, Meta anunció Llama 2 (estilizada como LLaMa 2), la siguiente generación de Llama. Meta entrenó y lanzó Llama 2 en tres tamaños de modelo: 7, 13 y 70 mil millones de parámetros. La arquitectura del modelo permanece en gran medida sin cambios respecto a la de los modelos Llama 1, pero se utilizó un 40% más de datos para entrenar los modelos fundacionales.
Llama 2 incluye modelos fundacionales y modelos ajustados para chat. En una desviación adicional de la versión original de Llama, todos los modelos se lanzan con pesos y pueden usarse para muchos casos de uso comercial. Debido a que la licencia de Llama impone una política de uso aceptable que prohíbe que Llama se use para algunos propósitos, no es de código abierto. El uso por parte de Meta del término código abierto para describir Llama ha sido disputado por la Open Source Initiative (que mantiene la Definición de Código Abierto) y otros.
Code Llama es un ajuste fino de Llama 2 con conjuntos de datos específicos de código. Se lanzaron versiones de 7B, 13B y 34B el 24 de agosto de 2023, con una versión de 70B lanzada el 29 de enero de 2024. Comenzando con los modelos fundacionales de Llama 2, Meta AI entrenaría 500 mil millones de tokens adicionales de conjuntos de datos de código, antes de 20 mil millones de tokens adicionales de datos de contexto largo, creando los modelos fundacionales de Code Llama. Este modelo fundacional se entrenó aún más con 5 mil millones de tokens de seguimiento de instrucciones para crear el ajuste fino de instrucciones. Se creó otro modelo fundacional para código Python, que se entrenó con 100 mil millones de tokens de código solo de Python, antes de los datos de contexto largo.
Llama 3
El 18 de abril de 2024, Meta lanzó Llama 3 con dos tamaños: 8B y 70B de parámetros. Los modelos han sido preentrenados con aproximadamente 15 billones de tokens de texto recopilados de "fuentes disponibles públicamente", con los modelos de instrucciones ajustados con "conjuntos de datos de instrucciones disponibles públicamente, así como más de 10 millones de ejemplos anotados por humanos". Las pruebas de Meta AI mostraron en abril de 2024 que Llama 3 70B superaba a Gemini Pro 1.5 y Claude 3 Sonnet en la mayoría de los puntos de referencia. Meta también anunció planes para hacer Llama 3 multilingüe y multimodal, mejor en codificación y razonamiento, y para aumentar su ventana de contexto.
En cuanto a las leyes de escalado, los modelos Llama 3 mostraron empíricamente que cuando un modelo se entrena con datos que superan la cantidad "óptima de Chinchilla", el rendimiento continúa escalando log-linealmente. Por ejemplo, el conjunto de datos óptimo de Chinchilla para Llama 3 8B es de 200 mil millones de tokens, pero el rendimiento continuó escalando log-linealmente hasta el conjunto de datos 75 veces más grande de 15 billones de tokens. Durante una entrevista con Dwarkesh Patel, Mark Zuckerberg dijo que la versión de 8B de Llama 3 era casi tan potente como la Llama 2 más grande. En comparación con modelos anteriores, Zuckerberg declaró que el equipo se sorprendió de que el modelo de 70B todavía estuviera aprendiendo incluso al final del entrenamiento de 15 billones de tokens. Se tomó la decisión de terminar el entrenamiento para enfocar la potencia de GPU en otros lugares.
Llama 3.1 fue lanzado el 23 de julio de 2024, con tamaños de 8B, 70B y 405B de parámetros. El modelo de 405B fue el primer Llama en ser un modelo de mezcla de expertos, y fue lanzado bajo una licencia que permite la redistribución y modificación, pero con restricciones sobre su uso para mejorar otros modelos de lenguaje de gran tamaño. Llama 3.2 fue lanzado el 25 de septiembre de 2024, con tamaños de 1B y 3B para dispositivos de borde, y 11B y 90B para tareas de visión. Llama 3.3 fue lanzado el 6 de diciembre de 2024, con un modelo de 70B optimizado para eficiencia.
Llama 4
Llama 4 fue lanzado en abril de 2025. El lanzamiento inicial incluyó Llama 4 Scout, Maverick y Behemoth. Scout y Maverick fueron lanzados como modelos de pesos abiertos, mientras que Behemoth fue lanzado como una vista previa. Scout es un modelo de 17B de parámetros con una ventana de contexto de 10 millones de tokens, y Maverick es un modelo de mezcla de expertos de 400B de parámetros con una ventana de contexto de 1 millón de tokens. Behemoth es un modelo de mezcla de expertos de 2 billones de parámetros que aún estaba en entrenamiento en el momento del lanzamiento.
Recepción e Impacto
El lanzamiento inicial de Llama, particularmente la fuga, tuvo un impacto significativo en la comunidad de IA. La accesibilidad de modelos más pequeños permitió la investigación y el desarrollo en hardware de consumo, fomentando una proliferación de variantes ajustadas y herramientas. Los modelos Llama han sido ampliamente utilizados en investigación académica y aplicaciones comerciales, y han influido en lanzamientos posteriores de modelos de pesos abiertos de otras organizaciones. El lanzamiento de Llama 3 y Llama 4 continuó esta tendencia, con Meta posicionando a Llama como una alternativa líder de pesos abiertos a los modelos propietarios de OpenAI, Anthropic y Google DeepMind.