Meta Llama é uma família de modelos de linguagem de grande porte (LLMs) desenvolvidos pela Meta AI, lançados pela primeira vez em fevereiro de 2023. O nome "Llama" serve como um backronym para "Large Language Model Meta AI". Os modelos são projetados para serem acessíveis para pesquisa e uso comercial, com tamanhos de parâmetros variando de 1 bilhão a mais de 2 trilhões. Inicialmente, Llama era um modelo de fundação, mas a partir do Llama 2, a Meta AI também lançou versões ajustadas por instruções. A versão mais recente, Llama 4, foi lançada em abril de 2025, e em abril de 2026, a Meta Superintelligence Labs introduziu o Muse Spark como um substituto para o Llama.
Histórico
O desenvolvimento do Meta Llama ocorreu no contexto de avanços rápidos em modelos de linguagem de grande porte. Após o lançamento de modelos como GPT-3, a pesquisa se concentrou em up-scaling, que às vezes levava a ganhos significativos em capacidades emergentes. O lançamento do ChatGPT e seu sucesso inesperado aumentaram a atenção pública e da indústria sobre LLMs. Em resposta ao ChatGPT, o cientista-chefe de IA da Meta, Yann LeCun, comentou que modelos de linguagem de grande porte são particularmente úteis para auxiliar em tarefas de escrita, refletindo uma postura cautelosa, mas engajada, da Meta.
Lançamento Inicial e Vazamento
A primeira versão do Llama, estilizada como LLaMA e às vezes chamada de Llama 1, foi anunciada em 24 de fevereiro de 2023, por meio de uma postagem de blog e um artigo detalhando seu treinamento, arquitetura e desempenho. O código de inferência foi lançado sob a licença de código aberto GPLv3, mas o acesso aos pesos do modelo foi restrito a pesquisadores acadêmicos e organizações afiliadas, concedido caso a caso. O modelo foi treinado em dados publicamente disponíveis e veio em múltiplos tamanhos para acomodar diferentes capacidades de hardware. Meta relatou que o modelo de 13B parâmetros superava o muito maior GPT-3 (175B parâmetros) na maioria dos benchmarks de NLP, e o maior modelo de 65B era competitivo com modelos de estado da arte como PaLM e Chinchilla.
Em 3 de março de 2023, um torrent contendo os pesos do Llama foi vazado no 4chan e se espalhou pelas comunidades de IA. Meta protocolou pedidos de remoção contra repositórios do HuggingFace e um script do GitHub, citando distribuição não autorizada e violação de direitos autorais. As reações foram mistas: alguns temeram uso indevido, enquanto outros celebraram a acessibilidade, comparando-a à distribuição aberta do Stable Diffusion,que impulsionou inovação rápida.
Llama 2
Em 18 de julho de 2023, em parceria com a Microsoft, Meta anunciou o Llama 2, disponível em tamanhos de 7B, 13B,e 70B parâmetros. A arquitetura foi amplamente inalterada em relação ao Llama 1, mas os dados de treinamento foram aumentados em 40%. O Llama 2 incluiu modelos de fundação e ajustados por chat, com pesos lançados para uso comercial sob uma licença que impunha uma política de uso aceitável, levando a disputas sobre se ele se qualifica como código aberto. A Open Source Initiative argumentou que as restrições da licença impedem que ele seja verdadeiramente código aberto.
Code Llama, um ajuste fino do Llama 2 para geração de código, foi lançado em 24 de agosto de 2023, em versões de 7B, 13B,e 34B, com uma versão de 70B seguindo em 29 de janeiro de 2024. O treinamento envolveu 500B tokens adicionais de dados de código e 20B tokens de dados de contexto longo, com ajuste fino adicional para seguir instruções e modelos específicos para Python.
Llama 3
Em 18 de abril de 2024, Meta lançou o Llama 3 com tamanhos de 8B e 70B parâmetros. Esses modelos foram pré-treinados em aproximadamente 15 trilhões de tokens de fontes publicamente disponíveis, com modelos de instrução ajustados finamente em conjuntos de dados de instrução públicos e mais de 10 milhões de exemplos anotados por humanos. Os benchmarks da Meta mostraram que o Llama 3 70B superava o Gemini Pro 1.5 e o Claude 3 Sonnet na maioria dos testes. Meta anunciou planos para capacidades multilíngues e multimodais, melhoria de codificação e raciocínio, e uma janela de contexto maior.
O Llama 3 demonstrou que o desempenho continua a escalar log-linearmente mesmo além da quantidade de dados de treinamento ótima de Chinchilla. Por exemplo, o conjunto de dados ótimo de Chinchilla para o modelo de 8B é de 200 bilhões de tokens, mas o desempenho melhorou até 15 trilhões de tokens. Mark Zuckerberg observou que a versão de 8B era quase tão poderosa quanto o maior Llama 2, e o modelo de 70B ainda estava aprendendo no final do treinamento, que foi interrompido para alocar recursos de GPU em outros lugares.
O Llama 3.1 foi lançado em 23 de julho de 2024, com melhorias adicionais e comprimentos de contexto expandidos.
Llama 4 e Sucessor
O Llama 4 foi lançado em abril de 2025, continuando a evolução da família de modelos com capacidades aprimoradas. Em abril de 2026, a Meta Superintelligence Labs lançou o Muse Spark como um substituto para o Llama, marcando uma transição para uma nova geração de modelos.
Aplicações e Ecossistema
Os modelos Meta Llama foram integrados em vários produtos e serviços. Junto com o Llama 3, Meta lançou o Meta AI, um assistente de IA construído sobre o Llama, disponível em um site dedicado e plataformas como Facebook e WhatsApp. Os modelos também são usados por desenvolvedores terceirizados e provedores de nuvem, incluindo Amazon Web Services, Microsoft Azure,e Google Cloud,para oferecer capacidades de LLM a empresas. A natureza de pesos abertos do Llama promoveu um ecossistema vibrante de variantes ajustadas finamente e ferramentas, similar à comunidade em torno de modelos de IA generativa.
Recepção e Impacto
O lançamento dos modelos Llama teve um impacto significativo no cenário de IA. O vazamento do Llama 1 democratizou o acesso a LLMs poderosos, permitindo pesquisa e experimentação fora de grandes corporações. O Llama 2 e versões subsequentes forneceram uma alternativa comercialmente viável a modelos proprietários como os da OpenAI e da Anthropic. No entanto, os termos de licenciamento geraram debates sobre a definição de código aberto, com críticos observando que a política de uso aceitável restringe certas aplicações. Apesar disso, o Llama se tornou um benchmark para modelos de pesos abertos, influenciando o desenvolvimento de outros esforços de código aberto em inteligência artificial.
Arquitetura Técnica
Os modelos Llama são baseados na arquitetura Transformer, utilizando atenção de múltiplas cabeças e codificação posicional. Eles empregam técnicas como normalização de camada e conexões residuais para estabilizar o treinamento. Os modelos são treinados usando variantes de SGD como Adam, com agendamentos de taxa de aprendizado e recorte de gradiente. Para inferência, amostragem top-k e amostragem top-p são comumente usadas, junto com escalonamento de temperatura. As leis de escalonamento observadas no Llama 3 informaram pesquisa sobre tamanhos ótimos de dados de treinamento, contribuindo para a compreensão mais ampla de aprendizado profundo e redes neurais.
Direções Futuras
Com a introdução do Muse Spark em 2026, a Meta Superintelligence Labs visa empurrar os limites das capacidades de IA, potencialmente incorporando avanços em aprendizado de máquina e IA generativa. A transição do Llama para o Muse Spark sugere uma mudança estratégica em direção a modelos mais poderosos e eficientes, provavelmente construindo sobre as lições aprendidas com o desenvolvimento do Llama. À medida que o campo evolui, as contribuições da Meta continuam a moldar o cenário de modelos de IA de pesos abertos, equilibrando inovação com considerações de segurança e acessibilidade.