La filtración de Llama se refiere a la distribución no autorizada de los pesos del modelo LLaMA (Large Language Model Meta AI) de Meta AI en marzo de 2023. Este evento marcó un punto de inflexión en el desarrollo de los modelos de lenguaje grandes, ya que eludió la política de acceso controlado de Meta y puso los pesos a disposición del público a través de BitTorrent y HuggingFace. La filtración aceleró la investigación de IA de código abierto al permitir que una comunidad más amplia de desarrolladores e investigadores experimentara y construyera sobre los modelos, a pesar de las preocupaciones iniciales sobre el uso indebido.
La filtración ocurrió poco después de que Meta anunciara LLaMA el 24 de febrero de 2023, como una familia de modelos fundacionales que van desde 1 mil millones hasta 65 mil millones de parámetros. A diferencia de modelos contemporáneos como el GPT-3 de OpenAI, que eran cerrados, los pesos de LLaMA estaban destinados a investigadores académicos bajo una licencia no comercial. La filtración democratizó el acceso, lo que llevó a una proliferación de variantes y herramientas ajustadas, e influyó en los lanzamientos posteriores de Llama 2 y Llama 3 por parte de Meta, que se hicieron más abiertamente disponibles.
Antecedentes
A principios de la década de 2020, el campo de la inteligencia artificial experimentó un aumento de interés tras el lanzamiento del ChatGPT de OpenAI en noviembre de 2022. Esto provocó una carrera entre las empresas tecnológicas para desarrollar modelos de lenguaje grandes más potentes. Meta, bajo su división de investigación de IA Meta AI, adoptó una estrategia de investigación abierta, pero con restricciones en el acceso a los modelos. El científico jefe de IA de Meta, Yann LeCun, expresó escepticismo sobre el revuelo, afirmando que los modelos de lenguaje grandes son mejores para ayudar con la escritura, no para lograr inteligencia a nivel humano.
El proyecto LLaMA tenía como objetivo crear modelos eficientes que pudieran ejecutarse en hardware de consumo, en contraste con la escala masiva de modelos como GPT-3 (175 mil millones de parámetros). Meta entrenó LLaMA en datos disponibles públicamente, utilizando una arquitectura transformer, y lanzó el código de inferencia bajo una licencia de código abierto, pero mantuvo los pesos restringidos.
Lanzamiento inicial y filtración
El 24 de febrero de 2023, Meta AI anunció LLaMA a través de una publicación de blog y un artículo que detallaba su entrenamiento y rendimiento. Los modelos venían en tamaños de 7B, 13B, 33B y 65B parámetros. Meta informó que el modelo de 13B superaba a GPT-3 en muchos puntos de referencia de PNL, y el modelo de 65B era competitivo con modelos de última generación como PaLM y Chinchilla. El acceso a los pesos se otorgaba caso por caso a investigadores académicos, gobiernos, sociedad civil y laboratorios de investigación industrial.
El 3 de marzo de 2023, se subió un torrent que contenía los pesos, con el enlace compartido en 4chan y difundido rápidamente en las comunidades de IA en línea. Ese mismo día, una solicitud de extracción en el repositorio oficial de LLaMA solicitó agregar el enlace magnético a la documentación. El 4 de marzo, otra solicitud de extracción agregó enlaces a repositorios de HuggingFace que alojaban el modelo. Meta respondió presentando solicitudes de eliminación a HuggingFace el 6 de marzo, caracterizando la distribución como no autorizada, y HuggingFace cumplió. El 20 de marzo, Meta presentó una solicitud de eliminación DMCA contra un repositorio de GitHub que contenía un script de descarga, que se eliminó al día siguiente.
La filtración fue recibida con reacciones mixtas. Algunos temieron un uso malicioso, como spam sofisticado o desinformación. Otros celebraron la accesibilidad, señalando que los modelos más pequeños podían ejecutarse en hardware modesto, fomentando la investigación y la innovación. Comentaristas como Simon Willison compararon LLaMA con Stable Diffusion, un modelo de texto a imagen abierto que impulsó un rápido crecimiento del ecosistema. La filtración efectivamente obligó a Meta a reconsiderar su estrategia de lanzamiento.
Llama 2
El 18 de julio de 2023, Meta, en asociación con Microsoft, anunció Llama 2, la siguiente generación. Llama 2 se lanzó en tres tamaños: 7B, 13B y 70B parámetros. La arquitectura era en gran medida la misma que la de Llama 1, pero los datos de entrenamiento se aumentaron en un 40%. A diferencia del original, Llama 2 incluía tanto modelos fundacionales como versiones ajustadas con instrucciones para chat. Todos los modelos se lanzaron con pesos y permitían uso comercial, sujeto a una política de uso aceptable. Sin embargo, esta licencia no fue aprobada por la Open Source Initiative, lo que llevó a disputas sobre si Llama 2 podía llamarse código abierto.
El lanzamiento de Llama 2 marcó un cambio hacia una distribución más abierta, influenciado en parte por la filtración. Permitió una ola de modelos ajustados y aplicaciones comerciales. Meta también lanzó Code Llama, un ajuste de Llama 2 para generación de código, con versiones el 24 de agosto de 2023 (7B, 13B, 34B) y el 29 de enero de 2024 (70B).
Llama 3
El 18 de abril de 2024, Meta lanzó Llama 3 con tamaños de 8B y 70B parámetros. Estos modelos se preentrenaron con aproximadamente 15 billones de tokens de texto disponible públicamente, con ajuste de instrucciones en más de 10 millones de ejemplos anotados por humanos. Los puntos de referencia de Meta mostraron que Llama 3 70B superaba a Gemini Pro 1.5 y Claude 3 Sonnet en muchas tareas. Meta anunció planes para capacidades multilingües y multimodales, ventanas de contexto más largas y mejoras en codificación y razonamiento.
Llama 3 demostró que el rendimiento continúa escalando log-linealmente incluso más allá de la cantidad de datos de entrenamiento óptima de Chinchilla. Por ejemplo, el conjunto de datos óptimo de Chinchilla para el modelo de 8B era de 200 mil millones de tokens, pero el rendimiento mejoró hasta 15 billones de tokens. Durante una entrevista, Mark Zuckerberg señaló que el modelo de 8B era casi tan potente como el Llama 2 más grande, y el modelo de 70B aún estaba aprendiendo al final del entrenamiento, pero se detuvo el entrenamiento para asignar recursos de GPU en otros lugares.
Llama 3.1 se lanzó el 23 de julio de 2024, con mejoras adicionales, incluido un modelo de 405B parámetros, y continuó la tendencia de lanzamientos de pesos abiertos.
Impacto en la IA de código abierto
La filtración de Llama catalizó el movimiento de IA de código abierto. Antes de la filtración, el acceso a los LLM de última generación estaba en gran medida limitado a unas pocas organizaciones. La filtración permitió a investigadores independientes y aficionados ejecutar y ajustar modelos localmente, lo que llevó a innovaciones en poda de modelos, aumento de datos e inferencia eficiente. También inspiró la creación de ecosistemas de código abierto, como repositorios de HuggingFace y herramientas como llama.cpp, que permitieron la inferencia basada en CPU.
La filtración también presionó a Meta para adoptar licencias más permisivas en versiones posteriores, como se vio con Llama 2 y Llama 3. Este cambio influyó en otras empresas, como Mistral AI, para lanzar modelos de pesos abiertos. Sin embargo, el debate sobre lo que constituye "código abierto" en IA continuó, con organizaciones como la Open Source Initiative argumentando que las restricciones sobre el uso y la redistribución violan la Definición de Código Abierto.
Reacciones y controversias
Las reacciones a la filtración fueron polarizadas. Los expertos en seguridad advirtieron sobre un posible uso indebido, como la generación de correos de phishing o desinformación. Algunos investigadores celebraron la democratización de la IA, permitiendo experimentos que de otro modo serían imposibles. La filtración también planteó preguntas sobre la ética de lanzar modelos potentes, lo que llevó a discusiones sobre el desarrollo responsable de la IA.
La respuesta de Meta a la filtración fue inicialmente legal, pero la empresa finalmente adoptó la apertura. Para 2024, Meta posicionó a Llama como una familia líder de modelos de pesos abiertos, compitiendo con modelos cerrados de OpenAI y Google DeepMind. La filtración también destacó la dificultad de controlar la distribución digital, ya que una vez que los pesos son públicos, no se pueden retirar por completo.
Legado
La filtración de Llama se considera un evento fundamental en la historia de la IA. Aceleró el desarrollo de LLM de código abierto, lo que llevó a un ecosistema diverso de modelos y aplicaciones. También influyó en las discusiones políticas sobre la regulación de la IA y el equilibrio entre apertura y seguridad. A partir de 2025, los modelos Llama se utilizan ampliamente en investigación e industria, y Meta continúa lanzando nuevas versiones, incluido Llama 4 en abril de 2025. En abril de 2026, Meta Superintelligence Labs lanzó Muse Spark como reemplazo de Llama, marcando el siguiente capítulo en el viaje de IA de Meta.
La filtración demostró que el acceso abierto puede impulsar la innovación, pero también requiere una consideración cuidadosa de los posibles daños. Sigue siendo un caso de estudio en los desafíos de gobernar la tecnología de IA en la era digital.