Meta Llama 4 es una familia de modelos de lenguaje de gran tamaño desarrollada por Meta AI, lanzada en abril de 2025 como sucesora de Llama 3. Se destaca por ser un modelo multimodal nativo, capaz de procesar y generar texto e imágenes, y por su ventana de contexto extendida de 10 millones de tokens, lo que le permite manejar documentos muy largos o entradas multimodales en una sola pasada. El lanzamiento continuó la estrategia de Meta de distribución de pesos abiertos, haciendo que los modelos estén disponibles para investigación y uso comercial bajo una licencia que permite muchas aplicaciones, aunque no completamente de código abierto según la definición de la Open Source Initiative.
La serie Llama comenzó en febrero de 2023 con el lanzamiento inicial de Llama 1, que estaba disponible solo para investigadores bajo una licencia no comercial, pero sus pesos se filtraron públicamente a través de BitTorrent poco después. Las versiones posteriores, comenzando con Llama 2 en julio de 2023, se lanzaron con licencias más permisivas, permitiendo el uso comercial. Llama 3, lanzado en abril de 2024, introdujo modelos con hasta 70 mil millones de parámetros y fue entrenado con 15 billones de tokens. Llama 4 se basó en esta base, añadiendo multimodalidad nativa y una ventana de contexto dramáticamente más grande, posicionándose como una respuesta competitiva a modelos de OpenAI, Anthropic y Google DeepMind.
Antecedentes
El desarrollo de Llama 4 ocurrió en el contexto de rápidos avances en las capacidades de los Large language model. El lanzamiento de ChatGPT en noviembre de 2022 había provocado un aumento en el interés y la inversión en IA generativa, llevando a una carrera entre empresas tecnológicas para producir modelos más potentes y eficientes. El científico jefe de IA de Meta, Yann LeCun, había expresado previamente escepticismo sobre el potencial último de los modelos de lenguaje de gran tamaño, sugiriendo que son más adecuados para ayudar con la escritura que para lograr inteligencia general. No obstante, Meta continuó invirtiendo fuertemente en su serie Llama, con el objetivo de competir con modelos propietarios ofreciendo alternativas de pesos abiertos.
Para 2025, el panorama incluía modelos como GPT-4 de OpenAI, Claude de Anthropic y Gemini de Google DeepMind, todos los cuales estaban empujando los límites de lo posible con arquitecturas Transformer (architecture). El enfoque de Meta con Llama 4 fue diferenciarse a través del acceso abierto e innovaciones técnicas, como la multimodalidad nativa y una ventana de contexto extremadamente larga, lo que podría habilitar nuevas aplicaciones en análisis de documentos, generación de código y razonamiento multimodal.
Arquitectura y Capacidades
Llama 4 fue diseñado como un modelo multimodal nativo, lo que significa que fue entrenado desde el principio con datos de texto e imágenes, en lugar de añadir capacidades de visión como una idea posterior. Este enfoque permite al modelo comprender y generar contenido a través de modalidades, habilitando tareas como subtitulado de imágenes, respuesta a preguntas visuales y generación intercalada de texto e imagen. La arquitectura del modelo se basa en el marco Transformer (architecture), con modificaciones para soportar entradas y salidas multimodales.
Una de las características más significativas de Llama 4 es su ventana de contexto de 10 millones de tokens. Esto es un aumento sustancial en comparación con modelos anteriores, que típicamente soportaban ventanas de contexto de 128,000 tokens o menos. La ventana de contexto más grande permite al modelo procesar libros completos, bases de código largas o documentos multimodales extensos en una sola pasada, mejorando la coherencia y reduciendo la necesidad de fragmentación o resumen. Esta capacidad fue posible gracias a avances en Positional Encoding y Multi-Head Attention que permiten un manejo eficiente de secuencias largas.
Llama 4 se lanzó en múltiples tamaños, desde modelos más pequeños adecuados para dispositivos periféricos hasta modelos más grandes para despliegue en la nube. Los recuentos exactos de parámetros no fueron completamente divulgados, pero la familia incluía modelos con miles de millones a cientos de miles de millones de parámetros, siguiendo las tendencias de escalado observadas en versiones anteriores. Los modelos fueron entrenados con un conjunto de datos diverso de texto e imágenes disponibles públicamente, con un enfoque en datos de alta calidad para mejorar el rendimiento.
Entrenamiento y Datos
Meta AI entrenó a Llama 4 con un gran corpus de datos disponibles públicamente, incluyendo texto web, libros, código e imágenes. El proceso de entrenamiento implicó técnicas de Deep learning como Adam (Optimizer) y Learning Rate Scheduling para optimizar los parámetros del modelo. El uso de Data Augmentation y Curriculum Learning ayudó a mejorar la generalización y la robustez. Los modelos fueron preentrenados como modelos fundacionales y luego ajustados con datos de seguimiento de instrucciones, utilizando métodos como Reinforcement Learning from AI Feedback (RLAIF) (aprendizaje por refuerzo a partir de retroalimentación de IA) para alinearse con la intención del usuario.
Los datos de entrenamiento fueron curados para incluir una amplia gama de idiomas y dominios, haciendo que Llama 4 sea multilingüe y capaz de manejar diversas tareas. La inclusión de datos de imágenes requirió el desarrollo de nuevos pipelines de entrenamiento para manejar entradas multimodales, involucrando mecanismos de Cross-Attention para fusionar información de diferentes modalidades. Meta también empleó técnicas como Gradient Clipping y Batch Normalization para estabilizar el entrenamiento en clústeres a gran escala.
Lanzamiento y Disponibilidad
Llama 4 fue anunciado en abril de 2025, con los modelos disponibles para descarga desde el sitio web de Meta y a través de plataformas asociadas. El lanzamiento incluyó tanto modelos fundacionales como versiones ajustadas con instrucciones, similar a lanzamientos anteriores de Llama. Los pesos se distribuyeron bajo una licencia que permitía el uso comercial, pero con una política de uso aceptable que restringía ciertas aplicaciones, como la generación de spam o la vigilancia. Esto llevó a un debate continuo sobre si los modelos podían considerarse verdaderamente de código abierto, ya que el OpenPanel y otras organizaciones señalaron que la licencia no cumplía con la Definición de Código Abierto.
Meta también integró Llama 4 en su asistente Meta AI, que está disponible en Facebook, WhatsApp y un sitio web dedicado. Esto permitió a los usuarios interactuar con el modelo para tareas como responder preguntas, generar contenido y analizar imágenes. El lanzamiento fue acompañado de benchmarks que mostraban que Llama 4 se desempeñaba de manera competitiva con los modelos líderes de OpenAI, Anthropic y Google DeepMind en diversas tareas de procesamiento de lenguaje natural y multimodal.
Recepción e Impacto
El lanzamiento de Llama 4 fue recibido con un interés significativo por parte de la comunidad de IA, particularmente debido a su multimodalidad nativa y su larga ventana de contexto. Investigadores y desarrolladores elogiaron el enfoque de pesos abiertos, que permitía el ajuste fino y el despliegue en hardware personalizado, incluyendo chips AMD y Intel, así como plataformas en la nube como Amazon Web Services, Microsoft Azure y Google Cloud. La capacidad del modelo para manejar 10 millones de tokens abrió nuevas posibilidades para aplicaciones en revisión de documentos legales, investigación científica e ingeniería de software.
Sin embargo, algunos críticos señalaron que el rendimiento del modelo en ciertos benchmarks no siempre era superior al de modelos más pequeños y especializados, y que los recursos computacionales requeridos para la inferencia con una ventana de contexto tan grande podrían ser prohibitivos. El lanzamiento también planteó preocupaciones sobre el potencial de uso indebido, como la generación de contenido engañoso o deepfakes, dadas las capacidades multimodales del modelo. Meta abordó estas preocupaciones implementando filtros de seguridad y proporcionando pautas para un uso responsable.
Comparación con Competidores
Llama 4 entró en un mercado competitivo donde GPT-4 de OpenAI, Claude 3 de Anthropic y Gemini de Google DeepMind ya estaban establecidos. Cada uno de estos modelos tenía sus propias fortalezas: GPT-4 era conocido por su razonamiento general y habilidades de codificación, Claude 3 por su largo contexto y características de seguridad, y Gemini por su integración multimodal. Los diferenciadores clave de Llama 4 eran su distribución de pesos abiertos, que permitía la personalización y el despliegue local, y su ventana de contexto de 10 millones de tokens, que superaba a la de la mayoría de los competidores en ese momento.
En términos de rendimiento, los benchmarks de Llama 4 mostraron que era competitivo en tareas como benchmarks de Machine learning, pero no siempre el mejor puntuador. La naturaleza de pesos abiertos del modelo lo hizo atractivo para investigadores que querían estudiar o ajustar el modelo, y para empresas que preferían evitar la dependencia de un proveedor. El lanzamiento también impulsó la innovación en técnicas de inferencia eficiente, ya que los desarrolladores buscaban ejecutar los modelos grandes en hardware limitado.
Direcciones Futuras
Tras el lanzamiento de Llama 4, Meta continuó invirtiendo en su investigación de IA, con planes para mejorar las capacidades de razonamiento, codificación y multilingües del modelo. La empresa también exploró formas de reducir el costo computacional del entrenamiento y la inferencia, potencialmente utilizando hardware especializado como AWS Trainium o aceleradores Groq. En abril de 2026, Meta Superintelligence Labs lanzó Muse Spark como reemplazo de Llama, señalando un cambio hacia modelos más avanzados con capacidades aún mayores. Se esperaba que Muse Spark se basara en las lecciones aprendidas de Llama 4, incorporando nuevas arquitecturas y técnicas de entrenamiento para empujar los límites de lo posible en IA.
El legado de Llama 4 radica en su demostración de que los modelos de pesos abiertos pueden competir con los propietarios, y que la multimodalidad nativa y las ventanas de contexto largas son factibles a escala. También destacó la tensión continua entre apertura y seguridad en el desarrollo de IA, un debate que sigue dando forma al campo.