A Meta lançou o Llama 3, uma família de modelos de linguagem de grande porte (LLMs), em 18 de abril de 2024, como parte de sua série Llama em andamento. O lançamento incluiu dois tamanhos de modelo: 8 bilhões e 70 bilhões de parâmetros, ambos pré-treinados em aproximadamente 15 trilhões de tokens de texto de fontes publicamente disponíveis. Variantes ajustadas por instruções foram refinadas em conjuntos de dados públicos de instruções e em mais de 10 milhões de exemplos anotados por humanos. A Meta posicionou o Llama 3 como um passo significativo na IA de pesos abertos, com o modelo de 70B superando vários concorrentes comerciais em benchmarks padrão na época do lançamento.
A série Llama começou em fevereiro de 2023 com o Llama 1, inicialmente lançado apenas para pesquisadores sob uma licença não comercial. Após um vazamento não autorizado via BitTorrent em março de 2023, a Meta mudou sua estratégia com o Llama 2 em julho de 2023, oferecendo pesos para uso comercial mais amplo sob uma licença personalizada. O Llama 3 continuou essa trajetória, enfatizando acessibilidade e desempenho. O lançamento coincidiu com o Meta AI, um assistente construído sobre o Llama, disponível por meio de um site dedicado e integrado ao Facebook e ao WhatsApp.
Arquitetura do Modelo e Treinamento
Os modelos Llama 3 usam uma arquitetura de transformador padrão com melhorias em relação às versões anteriores. Os modelos de 8B e 70B foram treinados em 15 trilhões de tokens, um conjunto de dados 75 vezes maior do que a quantidade ideal de Chinchilla para o tamanho de 8B (200 bilhões de tokens). Apesar de exceder o ponto de dados ideal, o desempenho continuou a escalar log-linearmente, desafiando as leis de escalonamento convencionais. A Meta relatou que o modelo de 70B ainda estava melhorando no final do treinamento, mas a equipe optou por parar para alocar recursos de GPU em outros lugares.
Os dados de treinamento foram curados de fontes publicamente disponíveis, com ênfase em qualidade e diversidade. O ajuste fino por instruções usou uma combinação de conjuntos de dados públicos e exemplos anotados por humanos, aprimorando a capacidade dos modelos de seguir instruções complexas. A Meta também anunciou planos para tornar versões futuras multilíngues, multimodais e melhores em codificação e raciocínio, com uma janela de contexto aumentada.
Desempenho e Benchmarks
Em abril de 2024, os testes internos da Meta mostraram que o Llama 3 70B superou o Gemini Pro 1.5 e o Claude 3 Sonnet na maioria dos benchmarks, incluindo tarefas de raciocínio, codificação e conhecimento geral. O modelo de 8B foi relatado por Mark Zuckerberg como quase tão poderoso quanto o maior modelo Llama 2 (70B), demonstrando ganhos significativos de eficiência. Esses resultados posicionaram o Llama 3 como uma alternativa competitiva aos modelos proprietários de empresas como OpenAI, Anthropic e Google DeepMind.
Os modelos foram avaliados em benchmarks padrão de PNL, com a variante de 70B alcançando resultados de última geração entre modelos de pesos abertos na época. O comportamento de escalonamento observado - melhoria contínua além dos dados ideais de Chinchilla - sugeriu que conjuntos de dados maiores poderiam gerar ganhos adicionais, influenciando pesquisas subsequentes em aprendizado de máquina e aprendizado profundo.
Lançamento e Ecossistema
O Llama 3 foi lançado sob uma licença personalizada que permite uso comercial, embora com uma política de uso aceitável que restringia certas aplicações, gerando debates sobre se ele se qualificava como código aberto. Os pesos foram disponibilizados para download, e os modelos foram integrados em várias plataformas, incluindo Amazon Web Services, Azure, Google Cloud e Oracle Cloud. Provedores de hardware especializados, como Groq e SambaNova, otimizaram a inferência para o Llama 3, permitindo uma implantação mais rápida.
O lançamento estimulou uma onda de variantes e ferramentas ajustadas, semelhante ao ecossistema que surgiu em torno do Llama 2. Desenvolvedores usaram técnicas como RLHF e aprendizado curricular para adaptar os modelos a domínios específicos. A abordagem de pesos abertos contrastou com modelos fechados de concorrentes, fomentando a inovação em aplicações de IA generativa.
Desenvolvimentos Subsequentes
O Llama 3.1 foi lançado em 23 de julho de 2024, introduzindo um modelo de 405B parâmetros e expandindo a janela de contexto. Esta versão solidificou ainda mais a posição do Llama no cenário de IA. A série continuou com o Llama 4 em abril de 2025, e em abril de 2026, a Meta Superintelligence Labs lançou o Muse Spark como substituto. A evolução do Llama influenciou o campo mais amplo, com pesquisadores estudando leis de escalonamento e eficiência de treinamento, como visto em trabalhos sobre arquiteturas de transformadores e funções de perda.
O lançamento também destacou o papel da computação em larga escala, com a Meta aproveitando parcerias com fabricantes de chips como AMD, Intel e TSMC para treinar modelos de forma eficiente. O sucesso do Llama 3 contribuiu para discussões sobre o futuro da inteligência artificial e o equilíbrio entre desenvolvimento aberto e proprietário.