Llama (estilizado como LLaMA, con "Large Language Model Meta AI" como retroacrónimo) es una familia de modelos de lenguaje grandes (LLM) desarrollados por Meta AI, lanzados por primera vez en febrero de 2023. Los modelos varían en tamaño desde 1 billón hasta 2 billones de parámetros. Inicialmente, la primera versión era un modelo fundacional disponible solo para investigadores bajo una licencia no comercial, pero a partir de Llama 2, Meta lanzó versiones ajustadas con instrucciones junto con los modelos fundacionales, con una licencia más amplia. La filtración no autorizada de los pesos del primer modelo en marzo de 2023 a través de BitTorrent aceleró significativamente la proliferación de derivados y herramientas de LLM de código abierto.
Los modelos Llama se basan en la arquitectura Transformer (architecture), similar a otros LLM contemporáneos. Se han lanzado en múltiples versiones, cada una introduciendo mejoras en escala, datos de entrenamiento y capacidades. A partir de 2025, la última versión es Llama 4, lanzada en abril de 2025, y Meta también ha integrado Llama en su asistente Meta AI.
Antecedentes
Tras el lanzamiento de modelos de lenguaje grandes anteriores como GPT-3, un enfoque de investigación importante fue el aumento de escala de los modelos, lo que en algunos casos condujo a mejoras significativas en capacidades emergentes. El lanzamiento de ChatGPT a finales de 2022 y su éxito inesperado aumentaron drásticamente la atención pública e industrial sobre los LLM. En respuesta, el científico jefe de IA de Meta, Yann LeCun, comentó que los modelos de lenguaje grandes son más adecuados para ayudar con la escritura, reflejando una postura cautelosa en comparación con el despliegue agresivo de otras empresas tecnológicas.
Lanzamiento inicial
La primera versión de Llama (a veces referida como Llama 1) se anunció el 24 de febrero de 2023, mediante una publicación de blog y un artículo que detallaba su entrenamiento, arquitectura y rendimiento. El código de inferencia se lanzó bajo la licencia de código abierto GPLv3, pero el acceso a los pesos del modelo estaba restringido detrás de un proceso de solicitud, con acceso otorgado caso por caso a investigadores académicos, gobiernos, sociedad civil y laboratorios de investigación industrial. El modelo se entrenó exclusivamente con datos disponibles públicamente, con varios tamaños de modelo (7B, 13B, 33B y 65B parámetros) para adaptarse a diferentes capacidades de hardware. Era solo un modelo fundacional, aunque el artículo incluía ejemplos de ajuste fino con instrucciones.
Meta informó que el modelo de 13B parámetros superaba al mucho más grande GPT-3 (175B parámetros) en la mayoría de los puntos de referencia de PNL, y que el modelo más grande de 65B era competitivo con modelos de última generación como PaLM y Chinchilla.
Filtración y consecuencias
El 3 de marzo de 2023, se subió un torrent que contenía los pesos de Llama, con un enlace compartido en el foro de imágenes 4chan y posteriormente difundido a través de comunidades de IA en línea. Ese mismo día, una solicitud de extracción en el repositorio oficial de Llama solicitaba agregar el enlace magnético a la documentación. El 4 de marzo, otra solicitud de extracción agregó enlaces a repositorios de HuggingFace que alojaban el modelo. Meta presentó solicitudes de eliminación el 6 de marzo, caracterizando la distribución como no autorizada, y HuggingFace cumplió. El 20 de marzo, Meta presentó una solicitud de eliminación DMCA contra un repositorio que contenía un script para descargar Llama desde un espejo, y GitHub cumplió al día siguiente.
Las reacciones a la filtración fueron mixtas. Algunos especularon que el modelo podría usarse para fines maliciosos, como spam más sofisticado. Otros celebraron la accesibilidad, señalando que las versiones más pequeñas podían ejecutarse de manera relativamente económica, fomentando potencialmente más investigación. Comentaristas como Simon Willison compararon Llama con Stable Diffusion, un modelo de texto a imagen distribuido abiertamente que impulsó un rápido desarrollo de herramientas, sugiriendo un efecto similar para los LLM.
Llama 2
El 18 de julio de 2023, en asociación con Microsoft, Meta anunció Llama 2, la siguiente generación, con tamaños de modelo de 7B, 13B y 70B parámetros. La arquitectura permaneció en gran medida sin cambios respecto a Llama 1, pero el entrenamiento utilizó un 40% más de datos. Llama 2 incluía tanto modelos fundacionales como ajustados para chat, y todos los pesos se lanzaron para muchos usos comerciales. Sin embargo, debido a que la licencia incluye una política de uso aceptable, no se considera código abierto por la Iniciativa de Código Abierto, y el uso del término por parte de Meta ha sido disputado.
Code Llama, un ajuste fino de Llama 2 en conjuntos de datos específicos de código, se lanzó en versiones: 7B, 13B y 34B el 24 de agosto de 2023, y una versión de 70B el 29 de enero de 2024. Los modelos fundacionales se entrenaron con 500B tokens adicionales de datos de código, luego 20B tokens de datos de contexto largo, con un ajuste fino adicional de instrucciones en 5B tokens. Un modelo específico de Python se entrenó con 100B tokens de código Python.
Llama 3
El 18 de abril de 2024, Meta lanzó Llama 3 en dos tamaños: 8B y 70B parámetros. Los modelos se preentrenaron con aproximadamente 15 billones de tokens de fuentes disponibles públicamente, con modelos de instrucciones ajustados en conjuntos de datos de instrucciones públicos y más de 10 millones de ejemplos anotados por humanos. Las pruebas de Meta mostraron que Llama 3 70B superaba a Gemini Pro 1.5 y Claude 3 Sonnet en la mayoría de los puntos de referencia. Meta anunció planes para hacer Llama 3 multilingüe, multimodal, mejor en codificación y razonamiento, y para aumentar su ventana de contexto.
En cuanto a las leyes de escala, los modelos Llama 3 mostraron empíricamente que el rendimiento continúa escalando log-linealmente incluso más allá de la cantidad óptima de datos de entrenamiento según Chinchilla. Por ejemplo, el conjunto de datos óptimo según Chinchilla para Llama 3 8B es de 200 mil millones de tokens, pero el rendimiento mejoró hasta 15 billones de tokens (75 veces más). En una entrevista, Mark Zuckerberg señaló que la versión de 8B era casi tan potente como la más grande de Llama 2, y que el modelo de 70B aún estaba aprendiendo al final del entrenamiento, que se detuvo para asignar recursos de GPU a otros lugares.
Llama 3.1 se lanzó el 23 de julio de 2024, introduciendo un modelo de 405B parámetros, junto con versiones actualizadas de 8B y 70B, con una ventana de contexto más larga de 128K tokens y soporte multilingüe mejorado.
Llama 4 y más allá
Llama 4 se lanzó en abril de 2025, presentando una arquitectura de mezcla de expertos con tamaños de hasta 2 billones de parámetros. Introdujo capacidades multimodales y razonamiento mejorado. En abril de 2026, Meta Superintelligence Labs lanzó Muse Spark como reemplazo de Llama, señalando un cambio en la estrategia de IA de Meta.
Impacto y ecosistema
La filtración de los pesos de Llama 1 catalizó un vibrante ecosistema de código abierto, con numerosos ajustes finos y derivados emergentes. Permitió a investigadores y aficionados experimentar con LLM sin costos de API, lo que llevó a innovaciones en cuantización, inferencia eficiente y despliegue local. La disponibilidad de modelos más pequeños como 7B y 13B hizo factible ejecutar LLM en hardware de consumo, democratizando el acceso. Esto contrastó con los enfoques cerrados de otros laboratorios importantes como OpenAI y Anthropic, e influyó en lanzamientos posteriores de otras organizaciones. La controversia sobre la licencia también destacó tensiones entre los ideales de código abierto y el control corporativo, un debate que continúa en la comunidad de IA.