Lanzamiento de Meta Llama 2

Traducido del inglés

Llama 2 es una familia de modelos de lenguaje de gran tamaño lanzada por Meta AI en julio de 2023, notable por hacer que los pesos estén disponibles abiertamente para uso comercial, lo que amplió el ecosistema de IA de código abierto.

Llama 2 es una familia de modelos de lenguaje de gran tamaño (LLM) desarrollada por Meta AI, publicada el 18 de julio de 2023, en colaboración con Microsoft. Es el sucesor del modelo Llama original e incluye tanto modelos fundacionales como versiones de chat ajustadas con instrucciones. A diferencia de su predecesor, Llama 2 se puso a disposición con pesos para un uso comercial amplio, sujeto a una política de uso aceptable, lo que influyó significativamente en el ecosistema de IA de código abierto.

Los modelos Llama 2 forman parte del panorama más amplio de los modelos de lenguaje de gran tamaño, basándose en avances en arquitecturas de transformadores y técnicas de aprendizaje profundo. La publicación se consideró un paso importante hacia la democratización del acceso a una IA potente, proporcionando una alternativa competitiva a los modelos propietarios de empresas como OpenAI y Google DeepMind.

Antecedentes

El rápido progreso de los modelos de lenguaje de gran tamaño a principios de la década de 2020, que sentó las bases para Llama, está entrelazado con el éxito de las herramientas de IA generativa. La publicación de GPT-3 demostró que aumentar el tamaño del modelo podía producir mejoras drásticas en las capacidades. En noviembre de 2022, OpenAI lanzó ChatGPT, que ganó una atención generalizada y provocó un aumento en la investigación y la inversión en IA.

Meta AI, la rama de investigación de IA de Meta, había estado activa en el campo, con contribuciones notables como la arquitectura de transformadores desarrollada por investigadores de Google DeepMind y otros. El científico jefe de IA de Meta, Yann LeCun, expresó públicamente escepticismo sobre el hype en torno a los modelos de lenguaje de gran tamaño, afirmando que son más adecuados para ayudar con tareas de escritura, lo que refleja el enfoque de Meta en hacer que la IA sea más práctica y accesible.

Publicación inicial y filtración

La familia Llama original (Llama 1, estilizada como LLaMA) se anunció el 24 de febrero de 2023 mediante una publicación de blog y un artículo técnico. Estaba disponible en tamaños de 1 mil millones a 65 mil millones de parámetros, entrenada con datos disponibles públicamente. Inicialmente, los pesos del modelo solo eran accesibles para investigadores caso por caso bajo una licencia no comercial.

Sin embargo, los pesos pronto se filtraron en línea. En marzo de 2023, un torrent de los pesos se compartió en 4chan y se difundió rápidamente. Meta envió solicitudes de eliminación a HuggingFace y GitHub por los repositorios que alojaban el modelo, pero la filtración permitió un uso privado e investigación generalizados. Muchos consideraron la filtración como un punto de inflexión para la IA abierta, con comparaciones con Stable Diffusion que aceleraron la innovación.

Publicación de Llama 2

El 18 de julio de 2023, en colaboración con Microsoft, Meta anunció Llama 2, la próxima generación de la familia Llama. La compañía publicó tres tamaños de parámetros: 7 mil millones, 13 mil millones y 70 mil millones de parámetros. Meta también publicó tanto modelos fundacionales como variantes ajustadas. Específicamente, los ajustes de chat se diseñaron para uso conversacional.

Los modelos se entrenaron con un 40% más de datos que el Llama original, pero la arquitectura permaneció en gran medida sin cambios. Los modelos Llama 2 usaban bloques de redes residuales con mecanismos de atención, beneficiándose de normalización de capas y otras innovaciones. El ajuste de instrucciones utilizó técnicas de estilo RLAIF, combinando ajuste supervisado y retroalimentación humana.

Disponibilidad comercial y licencia

El aspecto más notable de la publicación de Llama 2 fue la decisión de proporcionar los pesos para uso gratuito en muchas aplicaciones comerciales. Meta publicó los modelos bajo una licencia personalizada que permite el uso, la reproducción y la modificación tanto para fines comerciales como de investigación, con algunas restricciones sobre los casos de uso definidos por la política.

Debido a la política de uso aceptable y otros términos, muchos críticos argumentaron que Llama 2 no era verdaderamente de código abierto según los estándares de la Open Source Initiative (OSI). No obstante, la disponibilidad de un modelo de lenguaje potente abierto para uso comercial fue un hito, permitiendo que organizaciones más pequeñas e individuos construyeran sobre la tecnología sin depender de API de pago.

La colaboración con Microsoft fue notable, ya que integró la publicación con su infraestructura de Azure. Los modelos se pusieron a disposición en el catálogo de modelos de IA de Azure, pero también se podían descargar directamente, lo que aumentó la accesibilidad.

Arquitectura del modelo y entrenamiento

Llama 2 empleó una arquitectura similar a su predecesor, pero con ajustes en el escalado. El tamaño del modelo alcanzaba hasta 70 mil millones de parámetros, lo que le permitía capturar patrones más complejos. El entrenamiento utilizó una mezcla de fuentes, incluyendo páginas web, libros y otros datos públicos, con un enfoque en el filtrado de calidad.

Un aspecto clave del proceso de entrenamiento implica optimizar la pérdida de entropía cruzada, utilizando principios como programas de tasa de aprendizaje y poda de modelos. Meta también incorporó técnicas como abandono y inicialización de pesos para mejorar el rendimiento.

Los modelos de 7B, 13B y 70B están disponibles, con el modelo de 70B diseñado para ejecutarse en múltiples GPU. Llama 2 se evaluó contra modelos contemporáneos como GPT-3 y Chinchilla, logrando resultados competitivos en varias tareas de referencia, incluyendo razonamiento y codificación.

Impacto en el ecosistema de IA de código abierto

La publicación de Llama 2, con acceso comercial, aceleró significativamente el crecimiento del ecosistema de IA de código abierto. Proporcionó una alternativa a los modelos propietarios, fomentando una comunidad de desarrolladores, investigadores y startups. Muchas empresas, como AI21-Labs y Inflection AI, usaron Llama 2 como base para sus propios modelos.

Además, la publicación se acompañó de la integración en servicios en la nube como Amazon Web Services, Google Cloud y Oracle Cloud, haciendo que el despliegue fuera accesible. Además, los proveedores de hardware AMD, Intel y Qualcomm optimizaron sus chips para ejecutar Llama de manera eficiente.

Derivados y ajustes finos

Los modelos Llama 2 se ajustaron con frecuencia para diversas aplicaciones. Un ejemplo notable es Code Llama, un ajuste fino con conjuntos de datos de código especializados. Publicado el 24 de agosto de 2023, inicialmente en versiones de 7B, 13B y 34B, y más tarde una versión de 70B el 29 de enero de 2024. Code Llama se entrenó con 500 mil millones de tokens de datos de código, siguiendo el modelo fundacional. La comunidad de IA generativa produjo muchos otros ajustes finos, como modelos para escritura creativa, asistencia legal y consejos médicos.

La accesibilidad de los pesos del modelo permitió a los investigadores aplicar técnicas como poda de modelos, cuantización de pesos, lo que hizo posible que pequeñas empresas de IA e instituciones educativas estudiaran y adaptaran la tecnología.

Respuesta y críticas

Las reacciones a Llama 2 fueron generalmente positivas, pero también preocupantes. Los partidarios elogiaron su potencial para democratizar la IA y fomentar la innovación, señalando que podía competir con modelos comerciales como GPT-3.5. Sin embargo, algunos críticos señalaron que las restricciones de la licencia no eran completamente "abiertas" según lo definido, limitando así su grado de libertad.

La política de uso aceptable restringía aplicaciones en áreas como vigilancia, spam y malware. Esto se debatió como un esfuerzo para prevenir el mal uso, pero también limitaba la flexibilidad.

Algunos investigadores también señalaron las preocupaciones ambientales y de recursos del entrenamiento de modelos grandes como Llama 2. El entrenamiento requería una potencia computacional significativa, lo que planteaba problemas éticos y prácticos.

Legado y futuro

Llama 2 estableció un nuevo estándar para la IA abierta, lo que llevó a la publicación posterior de Llama 3 en abril de 2024. La publicación tuvo un efecto duradero en la industria, empujando a los principales laboratorios comerciales a reconsiderar cómo se podían compartir los modelos. También fomentó el crecimiento de la colección de IA abierta como base para otros productos.

El enfoque de Llama 2 de proporcionar pesos con restricciones ha sido adoptado por otros desarrolladores para construir asistentes de IA como Meta AI, que ahora se basa en Llama 3. A finales de 2025, Llama es una familia de modelos, y a pesar de la aparición de nuevos modelos, Llama 2 sigue siendo un hito fundacional.

Resumen

En resumen, el anuncio de Meta Llama 2 fue un evento significativo en el avance de la IA generativa. Al combinar un rendimiento sólido con pesos permisivos, la decisión de Meta ayudó a dar forma al ecosistema de IA abierta. El evento se cita a menudo como uno de los bordes que avivó el interés de la IA comercial.

Desde su publicación, Llama 2 marcó una desviación de las prácticas más restringidas de otros modelos de IA, y su impacto fue generalizado.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-models·open-source-ai·meta-ai·artificial-intelligence
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial