Publicación de LLaMA 2

Traducido del inglés

LLaMA 2 es una familia de modelos de lenguaje grandes lanzada por Meta AI el 18 de julio de 2023, en colaboración con Microsoft, disponible en tamaños de parámetros de 7B, 13B y 70B, con versiones tanto de base como ajustadas para chat, destacada por su licencia de uso comercial.

LLaMA 2 es una familia de modelos de lenguaje de gran tamaño (LLM) lanzada por Meta AI el 18 de julio de 2023, en colaboración con Microsoft. Representa la segunda generación de la serie LLaMA (Large Language Model Meta AI), tras el lanzamiento inicial en febrero de 2023. Los modelos se pusieron a disposición en tres tamaños de parámetros - 7 mil millones, 13 mil millones y 70 mil millones - e incluían tanto modelos fundacionales como versiones ajustadas para aplicaciones de chat. Una diferencia clave respecto a su predecesor fue la licencia: todos los modelos LLaMA 2 se lanzaron con pesos y permitían muchos casos de uso comercial, aunque la política de uso aceptable de la licencia significaba que no se consideraba código abierto según la Open Source Initiative.

El lanzamiento marcó un cambio significativo en el enfoque de Meta hacia la distribución de modelos de IA. Mientras que el primer modelo LLaMA estaba restringido a investigadores académicos caso por caso, LLaMA 2 se hizo accesible a un público más amplio, incluidas entidades comerciales. Este movimiento formaba parte de una tendencia más amplia en la industria hacia lanzamientos de modelos más abiertos, aunque también generó debate sobre la definición de código abierto en el contexto de la IA. La arquitectura del modelo permaneció en gran medida sin cambios respecto a LLaMA 1, pero los datos de entrenamiento aumentaron en un 40%, mejorando el rendimiento en varios puntos de referencia.

Antecedentes y Contexto

El desarrollo de LLaMA 2 ocurrió en un contexto de rápido avance en los modelos de lenguaje de gran tamaño. Tras el éxito de modelos como GPT-3 y la sorprendente popularidad de ChatGPT, había una intensa competencia entre empresas tecnológicas por producir LLM capaces. El científico jefe de IA de Meta, Yann LeCun, había declarado públicamente que los modelos de lenguaje de gran tamaño eran más adecuados para ayudar en tareas de escritura, posicionando el enfoque de Meta dentro del discurso más amplio sobre las capacidades de la IA.

El primer modelo LLaMA, anunciado el 24 de febrero de 2023, ya había demostrado que los modelos más pequeños podían competir con otros mucho más grandes. La versión de 13B parámetros superó a GPT-3 (175B parámetros) en la mayoría de los puntos de referencia de PLN, mientras que el modelo de 65B era competitivo con sistemas de última generación como PaLM y Chinchilla. Esta eficiencia se debía en parte al entrenamiento con datos disponibles públicamente y al uso de técnicas avanzadas en aprendizaje profundo y diseño de redes neuronales.

Arquitectura del Modelo y Entrenamiento

La arquitectura de LLaMA 2 se basaba en el marco transformador, que se había convertido en el estándar para los modelos de lenguaje de gran tamaño. Los modelos se entrenaron utilizando mecanismos de atención multi-cabeza y codificación posicional, de acuerdo con el diseño de LLaMA 1. El proceso de entrenamiento implicó escalar el conjunto de datos en un 40% en comparación con la primera versión, permitiendo que los modelos aprendieran de un corpus de texto más extenso.

El modelo de 70B parámetros era el más grande de la familia, diseñado para aplicaciones de alto rendimiento, mientras que las versiones de 7B y 13B ofrecían opciones más accesibles para investigadores y desarrolladores con recursos computacionales limitados. Todos los modelos se lanzaron tanto como modelos fundacionales como versiones ajustadas por instrucciones, estas últimas afinadas para tareas de chat y conversación. Este lanzamiento dual fue una novedad para la serie LLaMA, que inicialmente había sido exclusivamente de modelos fundacionales.

Licencia y Disponibilidad Comercial

Una característica definitoria de LLaMA 2 fue su modelo de licencia. A diferencia de LLaMA 1, que estaba restringido a investigadores académicos bajo una licencia no comercial, LLaMA 2 se lanzó bajo una licencia que permitía el uso comercial, sujeta a una política de uso aceptable. Esta política prohibía ciertas aplicaciones, como aquellas que implicaban actividades ilegales o daño, pero permitía una amplia gama de usos legítimos.

La caracterización de LLaMA 2 como "código abierto" por parte de Meta fue cuestionada por la Open Source Initiative, que mantiene la Definición de Código Abierto. Los críticos argumentaban que la política de uso aceptable y otras restricciones significaban que la licencia no cumplía con los criterios para ser verdaderamente de código abierto. Este debate destacó las tensiones continuas en la comunidad de IA sobre lo que constituye apertura en los lanzamientos de modelos.

La disponibilidad comercial de LLaMA 2 fue significativa para empresas y startups, permitiéndoles integrar el modelo en productos sin necesidad de costosas tarifas de licencia de proveedores propietarios. Esto se consideró un contrapeso al dominio de los modelos cerrados de empresas como OpenAI y Anthropic.

Impacto y Recepción

El lanzamiento de LLaMA 2 fue recibido con considerable interés en la comunidad de IA. Su rendimiento, particularmente el modelo de 70B, era competitivo con otros modelos líderes de la época, y la licencia permisiva lo convertía en una opción atractiva tanto para investigación como para despliegue comercial. La disponibilidad de múltiples tamaños permitía a los usuarios elegir un modelo que se ajustara a sus capacidades de hardware, desde dispositivos de borde hasta servidores a gran escala.

Tras LLaMA 2, Meta continuó desarrollando la serie, lanzando Code Llama en agosto de 2023 para tareas específicas de código, y posteriormente LLaMA 3 en abril de 2024 con mejor rendimiento y conjuntos de datos de entrenamiento más grandes. La familia LLaMA se convirtió en una piedra angular de la estrategia de IA de Meta, culminando en el desarrollo de Meta AI, un asistente construido sobre LLaMA, y el eventual lanzamiento de LLaMA 4 en abril de 2025. En abril de 2026, Meta Superintelligence Labs introdujo Muse Spark como reemplazo de LLaMA, marcando la próxima evolución de los modelos de IA de Meta.

Detalles Técnicos y Variantes

Los modelos LLaMA 2 se entrenaron utilizando técnicas comunes en el desarrollo moderno de LLM, incluyendo el optimizador Adam y programas de tasa de aprendizaje. El proceso de entrenamiento también empleaba recorte de gradientes y normalización de capas para estabilizar el entrenamiento y mejorar la convergencia. Estos métodos eran estándar en el campo, reflejando el estado del arte en aprendizaje automático en ese momento.

Code Llama, una variante especializada de LLaMA 2, se ajustó en conjuntos de datos específicos de código. Las versiones de 7B, 13B y 34B se lanzaron el 24 de agosto de 2023, con una versión de 70B que siguió el 29 de enero de 2024. El entrenamiento implicó 500 mil millones de tokens adicionales de datos de código, seguidos de 20 mil millones de tokens de datos de contexto largo, creando modelos fundacionales para la generación general de código. Un ajuste adicional en 5 mil millones de tokens de seguimiento de instrucciones produjo las versiones instruct, y un modelo separado centrado en Python se entrenó con 100 mil millones de tokens de código Python.

Estos desarrollos técnicos posicionaron a LLaMA 2 como una plataforma versátil para diversas aplicaciones, desde el procesamiento del lenguaje natural hasta el desarrollo de software. El lanzamiento también impulsó la innovación en el ecosistema más amplio, con empresas como Amazon Web Services y Azure ofreciendo LLaMA 2 en sus plataformas en la nube, haciéndolo accesible a una gama más amplia de usuarios.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·meta-ai·artificial-intelligence·machine-learning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial