Llama 3.2 es una familia de modelos de lenguaje grandes desarrollada por Meta AI, publicada el 25 de septiembre de 2024. La familia incluye tanto modelos densos (parámetros de 1B y 3B) diseñados para aplicaciones en dispositivos como modelos más grandes (parámetros de 11B y 90B) con capacidades multimodales, que admiten entradas de texto e imágenes. Los modelos están disponibles bajo una licencia permisiva tanto para uso comercial como de investigación, con las variantes más pequeñas optimizadas para dispositivos de borde como teléfonos inteligentes y portátiles.
La publicación de Llama 3.2 marcó una expansión significativa de la serie Llama, siguiendo a los modelos anteriores Llama 3.1. Las variantes de 11B y 90B integran comprensión visual, lo que les permite procesar imágenes junto con texto, una característica ausente en versiones anteriores de Llama. Los modelos de 1B y 3B, en particular, están diseñados para ejecutarse eficientemente en hardware de consumo, con el modelo de 3B logrando un rendimiento comparable al de modelos más grandes en ciertos puntos de referencia.
Arquitectura y Entrenamiento
Los modelos Llama 3.2 se basan en la arquitectura Transformer (architecture), utilizando un diseño solo-decodificador con atención de consulta agrupada (GQA) para mejorar la eficiencia de inferencia. Los modelos de visión-lenguaje (11B y 90B) incorporan un codificador visual que procesa imágenes en tokens, que luego se fusionan con incrustaciones de texto. El entrenamiento involucró una combinación de datos solo de texto y multimodales, con un enfoque en el ajuste de instrucciones de alta calidad y técnicas de alineación como RLHF y ajuste fino supervisado.
Los modelos más pequeños (1B y 3B) se entrenaron con una longitud de contexto de 128,000 tokens, mientras que los modelos más grandes admiten hasta 128,000 tokens para texto y una torre visual separada para entradas de imagen. Los modelos utilizan un tamaño de vocabulario de 128,000 tokens y emplean normalización de capas y abandono para la estabilidad.
Rendimiento y Puntos de Referencia
Los modelos Llama 3.2 se han evaluado en una variedad de puntos de referencia públicos, incluidos MMLU, GSM8K y HumanEval. El modelo de 90B logra resultados competitivos frente a modelos líderes como OpenAI's GPT-4 y Anthropic's Claude 3.5 Sonnet en tareas como conocimiento general, razonamiento y codificación. El modelo de 3B, a pesar de su pequeño tamaño, supera a muchos modelos más grandes en tareas de seguimiento de instrucciones y resumen, lo que lo hace adecuado para aplicaciones en dispositivos.
En evaluaciones internas, el modelo de 90B obtuvo 86.0 en MMLU, 94.1 en GSM8K y 89.1 en HumanEval, mientras que el modelo de 11B logró 83.0 en MMLU, 88.4 en GSM8K y 84.9 en HumanEval. Estos resultados destacan la eficiencia de la arquitectura, con el modelo de 90B utilizando un diseño de mezcla de expertos (MoE) para algunas tareas, aunque las versiones densas estándar también están disponibles.
Despliegue y Ecosistema
Los modelos Llama 3.2 están integrados en las principales plataformas en la nube, incluidas AWS, Microsoft Azure, Google Cloud y Oracle Cloud. También son compatibles con proveedores de hardware como Groq, SambaNova e Intel, lo que permite una inferencia de baja latencia. Los modelos más pequeños están optimizados para el despliegue en el borde, con soporte para técnicas de cuantización y poda para reducir la huella de memoria.
Meta AI se ha asociado con Qualcomm y Samsung para habilitar funciones de IA en dispositivos en teléfonos inteligentes, aprovechando los modelos de 1B y 3B para tareas como resumen y generación de texto. Los modelos están disponibles a través del centro de Hugging Face y se pueden ajustar finamente utilizando marcos estándar como PyTorch y TensorFlow.
Recepción e Impacto
Llama 3.2 ha sido ampliamente adoptado en la comunidad de IA generativa, con muchos desarrolladores utilizando los modelos más pequeños para prototipado y aplicaciones de borde. La publicación del modelo de visión de 90B ha sido destacada por su capacidad para manejar tareas multimodales complejas, como comprensión de documentos y respuesta a preguntas visuales. Sin embargo, algunos críticos han señalado que los modelos aún enfrentan desafíos en precisión factual y sesgo, similar a otros modelos de lenguaje grandes.
El enfoque de pesos abiertos de Llama 3.2 ha sido elogiado por democratizar el acceso a la IA avanzada, pero también ha generado preocupaciones sobre un posible uso indebido. Meta ha implementado medidas de seguridad, incluidos red-teaming y filtrado de contenido, para mitigar riesgos.
Direcciones Futuras
Meta ha indicado que Llama 3.2 es parte de un ciclo de desarrollo continuo, con planes para mejoras adicionales en razonamiento, soporte multilingüe y eficiencia. La empresa también está explorando la integración con la investigación de redes neuronales de instituciones académicas como Stanford AI Lab y Berkeley AI Research. A partir de 2025, los modelos siguen siendo un punto de referencia para la IA de pesos abiertos, influyendo en publicaciones posteriores de otras organizaciones.