LLaMA 1 (Large Language Model Meta AI) fue el lanzamiento inaugural en la familia de grandes modelos de lenguaje de Meta, anunciado el 24 de febrero de 2023. El modelo fue diseñado como un modelo fundacional, entrenado exclusivamente con datos disponibles públicamente, y estaba disponible en tamaños de parámetros que iban desde 7 mil millones hasta 65 mil millones. Su lanzamiento marcó un cambio significativo en el panorama de los grandes modelos de lenguaje, ya que demostró un rendimiento competitivo frente a sistemas propietarios mucho más grandes, siendo al mismo tiempo más accesible para fines de investigación.
La distribución inicial de LLaMA 1 estaba restringida a investigadores académicos y laboratorios industriales bajo una licencia no comercial, con acceso otorgado caso por caso. Sin embargo, en cuestión de semanas tras su anuncio, los pesos del modelo se filtraron en línea, lo que llevó a una distribución no autorizada generalizada y provocó debates sobre el acceso abierto a los sistemas de IA.
Antecedentes y Contexto
El desarrollo de LLaMA 1 ocurrió durante un período de intenso interés en los grandes modelos de lenguaje tras el lanzamiento del GPT-3 de OpenAI y la posterior aparición de ChatGPT. El éxito de estos sistemas destacó el potencial de escalar las arquitecturas de redes neuronales, particularmente la arquitectura transformador, que se había convertido en el enfoque dominante en el procesamiento del lenguaje natural.
El científico jefe de IA de Meta, Yann LeCun, posicionó los grandes modelos de lenguaje como particularmente útiles para ayudar en tareas de escritura, distinguiendo el enfoque de Meta del de competidores que enfatizaban capacidades más amplias. La compañía buscaba crear un modelo más eficiente que pudiera ejecutarse en hardware menos potente, haciendo que la investigación avanzada en IA fuera más accesible para instituciones académicas con recursos computacionales limitados.
Lanzamiento Inicial y Arquitectura
La primera versión de LLaMA se anunció mediante una publicación de blog y un artículo de investigación adjunto que describía su metodología de entrenamiento, arquitectura y características de rendimiento. El código de inferencia se publicó bajo la licencia de código abierto GPLv3, mientras que los pesos del modelo permanecieron restringidos tras un proceso de solicitud. Este enfoque híbrido buscaba equilibrar la transparencia en la investigación con preocupaciones sobre un posible mal uso.
Meta entrenó LLaMA 1 en múltiples escalas, con la versión de 13 mil millones de parámetros superando a GPT-3 (175 mil millones de parámetros) en la mayoría de los puntos de referencia de PLN. El modelo más grande de 65 mil millones de parámetros logró resultados competitivos con sistemas de última generación como PaLM y Chinchilla. Los datos de entrenamiento consistían enteramente en fuentes disponibles públicamente, y los modelos fueron diseñados para ser más eficientes computacionalmente que sus contrapartes más grandes.
La Filtración y Sus Consecuencias
El 3 de marzo de 2023, un torrent con los pesos de LLaMA fue subido y compartido en el foro de imágenes 4chan, con enlaces que posteriormente se difundieron por comunidades de IA en línea. En cuestión de días, se abrieron solicitudes de extracción en el repositorio oficial de LLaMA para añadir enlaces magnéticos y referencias a repositorios de HuggingFace. Meta presentó solicitudes de eliminación el 6 de marzo, caracterizando la distribución como no autorizada, y HuggingFace cumplió con dichas solicitudes.
El 20 de marzo, Meta presentó una solicitud de eliminación DMCA contra un repositorio que contenía un script para descargar LLaMA desde un espejo, y GitHub cumplió al día siguiente. A pesar de estos esfuerzos, el modelo permaneció ampliamente accesible a través de varios sitios espejo y redes torrent.
Las reacciones a la filtración estuvieron divididas. Algunos comentaristas expresaron preocupación por posibles aplicaciones maliciosas, como la generación sofisticada de spam. Otros celebraron la mayor accesibilidad, señalando que las versiones más pequeñas del modelo podían ejecutarse a un costo relativamente bajo, lo que potencialmente aceleraría la investigación y la innovación. Simon Willison y otros comentaristas hicieron comparaciones con Stable Diffusion, el modelo de texto a imagen distribuido abiertamente que había provocado de manera similar una rápida proliferación de herramientas y técnicas.
Legado e Impacto
El lanzamiento de LLaMA 1 y su posterior filtración tuvieron efectos duraderos en el ecosistema de la IA. Demostró que los grandes modelos de lenguaje podían distribuirse de manera efectiva fuera de las grandes empresas tecnológicas, desafiando la suposición de que tales sistemas requerían infraestructura computacional masiva. La arquitectura del modelo y su enfoque de entrenamiento influyeron en modelos posteriores de pesos abiertos y contribuyeron al creciente movimiento de IA de código abierto.
La experiencia con LLaMA 1 moldeó el enfoque de Meta para lanzamientos posteriores. Llama 2, lanzado el 18 de julio de 2023, en asociación con Microsoft, incluía modelos tanto fundacionales como ajustados por instrucciones con una licencia comercial más amplia. Llama 3 le siguió el 18 de abril de 2024, con modelos entrenados en 15 billones de tokens y un rendimiento mejorado. La línea continuó con Llama 4 en abril de 2025, y Meta Superintelligence Labs lanzó Muse Spark como reemplazo en abril de 2026.
El legado de LLaMA 1 reside en su demostración de que grandes modelos de lenguaje competitivos podían construirse con recuentos de parámetros relativamente modestos y datos disponibles públicamente, al tiempo que también destacó los desafíos de controlar el acceso a sistemas de IA potentes una vez liberados.