LLaMA 2 é uma família de modelos de linguagem de grande escala (LLMs) lançada pela Meta AI em 18 de julho de 2023, em parceria com a Microsoft. Representa a segunda geração da série LLaMA (Large Language Model Meta AI), após o lançamento inicial em fevereiro de 2023. Os modelos foram disponibilizados em três tamanhos de parâmetros - 7 bilhões, 13 bilhões e 70 bilhões - e incluían tanto modelos fundacionais como versões ajustadas para aplicações de chat. Uma diferença fundamental em relação ao seu predecessor foi o licenciamento: todos os modelos LLaMA 2 foram lançados com pesos e permitían muitos casos de uso comercial, embora a política de uso aceitável da licença significasse que não era considerada código aberto pela Open Source Initiative.
O lançamento marcou uma mudança significativa na abordagem da Meta para a distribuição de modelos de IA. Enquanto o primeiro modelo LLaMA estava restringido a pesquisadores acadêmicos caso por caso, LLaMA 2 foi acessible a um público mais amplo, incluindo entidades comerciais. Este movimento fez parte de uma tendência mais ampla na indústria hacia lançamentos de modelos mais abertos, embora também tenha suscitado debate sobre a definição de código aberto no contexto da IA. A arquitetura do modelo permaneció em gran parte inalterada em relação a LLaMA 1, mas os dados de treinamento foram aumentados em 40%, melhorando o desempeño em vários benchmarks.
Antecedentes e Contexto
O desenvolvimento de LLaMA 2 ocorreu em um contexto de avanço rápido em modelos de linguagem de grande escala. Após o sucesso de modelos como GPT-3 e a popularidade surpreendente de ChatGPT, havia uma competição intensa entre empresas de tecnologia para produzir LLMs capazes. O cientista principal de IA da Meta, Yann LeCun, havia declarado publicamente que os modelos de linguagem de grande escala eram mais adequados para auxiliar em tarefas de escrita, posicionando a abordagem da Meta dentro do discurso mais amplo sobre as capacidades da IA.
O primeiro modelo LLaMA, anunciado em 24 de fevereiro de 2023, já havia demonstrado que modelos menores podían competir com outros muito maiores. A versão de 13B parâmetros superou a GPT-3 (175B parâmetros) na maioria dos benchmarks de PNL, enquanto o modelo de 65B era competitivo com sistemas de última generación como PaLM e Chinchilla. Esta eficiencia se debía em parte ao treinamento em dados disponíveis públicamente e ao uso de técnicas avançadas em aprendizado profundo e diseño de redes neurais.
Arquitectura e Treinamento do Modelo
A arquitetura de LLaMA 2 baseábase no framework Transformer (architecture), que se havia convertido no estándar para modelos de linguagem de grande escala. Os modelos foram treinados usando mecanismos de atenção multi-cabeza e codificación posicional, consistentes com o diseño de LLaMA 1. O processo de treinamento envolveu escalar o conjunto de dados em 40% em comparação com a primeira versión, permitindo que os modelos aprendessem de um corpus de texto mais extenso.
O modelo de 70B parâmetros era o maior da família, diseñado para aplicações de alto desempeño, enquanto as versões de 7B e 13B oferecían opções mais acessibles para pesquisadores e desenvolvedores com recursos computacionais limitados. Todos os modelos foram lançados tanto como modelos fundacionais como versões ajustadas por instruções, estas últimas ajustadas para tarefas de chat e conversacionais. Este lançamento duplo foi uma novidade para a série LLaMA, que inicialmente havia sido exclusivamente de modelos fundacionais.
Licenciamento e Disponibilidade Comercial
Uma característica definitoria de LLaMA 2 foi seu modelo de licenciamento. A diferença de LLaMA 1, que estava restringido a pesquisadores acadêmicos sob uma licencia não comercial, LLaMA 2 foi lançado sob uma licencia que permitía uso comercial, sujeta a uma política de uso aceitável. Esta política prohíbe certas aplicações, como aquelas que envolvem atividades ilegales ou dano, mas permitía uma amplia gama de usos legítimos.
A caracterização da Meta de LLaMA 2 como "código aberto" foi disputada pela Open Source Initiative, que mantiene The Open Source Definition. Os críticos argumentaron que a política de uso aceitável e outras restricciones significaban que a licencia não cumplía os critérios para verdadeiro código aberto. Este debate destacou tensões contínuas na comunidade de IA sobre o que constituye abertura em lançamentos de modelos.
A disponibilidade comercial de LLaMA 2 foi significativa para empresas e startups, permitindo-lhes integrar o modelo em produtos sem a necessidade de taxas de licenciamento caras de provedores proprietários. Isto foi visto como um contrapeso à dominância de modelos fechados de empresas como OpenAI e Anthropic.
Impacto e Recepción
O lançamento de LLaMA 2 foi recebido com considerável interesse na comunidade de IA. Seu desempeño, particularmente o modelo de 70B, era competitivo com outros modelos líderes da época, e a licencia permissiva o fez uma opción atractiva tanto para pesquisa como para implementación comercial. A disponibilidade de múltiples tamaños permitía aos usuários escolher um modelo que se ajustasse às suas capacidades de hardware, desde dispositivos de borde até servidores de grande escala.
Após LLaMA 2, a Meta continuou desenvolvendo a série, lançando Code Llama em agosto de 2023 para tarefas específicas de código, e posteriormente LLaMA 3 em abril de 2024 com desempeño melhorado e conjuntos de dados de treinamento maiores. A família LLaMA se convirtió em uma pedra angular da estratégia de IA da Meta, culminando no desenvolvimento de Meta AI, um assistente construido sobre LLaMA, e eventualmente o lançamento de LLaMA 4 em abril de 2025. Em abril de 2026, Meta Superintelligence Labs introdujo Muse Spark como um reemplazo para LLaMA, marcando a próxima evolución dos modelos de IA da Meta.
Detalles Técnicos e Variantes
Os modelos LLaMA 2 foram treinados usando técnicas comuns no desenvolvimento moderno de LLMs, incluindo optimizador Adam e agendamentos de taxa de aprendizado. O processo de treinamento também empregou recorte de gradiente e normalización de capas para estabilizar o treinamento e melhorar a convergencia. Estes métodos eram estándar no campo, refletindo o estado da arte em aprendizado automático na época.
Code Llama, uma variante especializada de LLaMA 2, foi ajustado em conjuntos de datos específicos de código. As versões de 7B, 13B e 34B foram lançadas em 24 de agosto de 2023, com uma versão de 70B seguindo em 29 de janeiro de 2024. O treinamento envolviu 500 bilhões de tokens adicionais de datos de código, seguidos de 20 bilhões de tokens de datos de contexto longo, criando modelos fundacionais para generación de código geral. Ajustes posteriores em 5 bilhões de tokens de seguimiento de instruções produjeron as versões de instrucciones, e um modelo separado focado em Python foi treinado em 100 bilhões de tokens de código Python.
Estes desenvolvimentos técnicos posicionaron LLaMA 2 como uma plataforma versátil para várias aplicações, desde processamento de linguagem natural até desenvolvimento de software. O lançamento também estimuló a innovación no ecosistema mais amplo, com empresas como Amazon Web Services e Azure oferecendo LLaMA 2 em suas plataformas de nube, fazendo-o acessible a uma gama más ampla de usuários.