Llama (modelo de linguagem)

Traduzido do inglês

Llama é uma família de modelos de linguagem de grande porte lançada pela Meta AI a partir de fevereiro de 2023, com os pesos da primeira versão vazados online em março de 2023, impulsionando um ecossistema de código aberto.

Llama (estilizado como LLaMA, com "Large Language Model Meta AI" como retroacrónimo) é uma família de modelos de linguagem de grande escala (LLMs) desenvolvida pela Meta AI, lançada pela primeira vez em fevereiro de 2023. Os modelos variam em tamanho de 1 bilhão a 2 trilhões de parámetros. Inicialmente, a primeira versão era um modelo fundamental disponível apenas para pesquisadores sob uma licença não comercial, mas a partir do Llama 2, Meta lançou versões ajustadas por instruções juntamente com modelos fundamentais, com licenciamento mais amplo. O vazamento não autorizado dos pesos do primeiro modelo em março de 2023 via BitTorrent acelerou significativamente a proliferação de derivados e ferramentas de LLM de código aberto.

Os modelos Llama são baseados na arquitetura Transformer (architecture), semelhante a outros LLMs contemporáneos. Eles foram lançados em múltiples versões, cada uma introduciendo melhorias em escala, dados de treinamento e capacidades. A partir de 2025, a versão mais recente é Llama 4, lançada em abril de 2025, e Meta também integrou Llama em seu assistente Meta AI.

Antecedentes

Após o lançamento de modelos de linguagem de grande escala anteriores como GPT-3, um foco importante de pesquisa foi o aumento de escala dos modelos, que em alguns casos levou a ganhos significativos em capacidades emergentes. O lançamento do ChatGPT no final de 2022 e seu inesperado sucesso aumentaram dramaticamente a atenção pública e da indústria nos LLMs. Em resposta, o principal cientista de IA da Meta, Yann LeCun, comentou que os modelos de linguagem de grande escala são mais adequados para auxiliar na escrita, refletindo uma postura cautelosa em comparação com a implementação agressiva de outras empresas de tecnologia.

Lançamento Inicial

A primeira versão do Llama (às vezes referida como Llama 1) foi anunciada em 24 de fevereiro de 2023, através de uma publicação de blog e um artigo detalhando seu treinamento, arquitetura e desempeño. O código de inferência foi lançado sob a licença de código aberto GPLv3, mas o acesso aos pesos do modelo foi condicionado a um processo de solicitação, com acesso concedido caso a caso a pesquisadores acadêmicos, governo, sociedade civil e laboratórios de pesquisa da indústria. O modelo foi treinado exclusivamente em dados disponíveis públicamente, com vários tamanhos de modelo (7B, 13B, 33B e 65B parámetros) para acomodar diferentes capacidades de hardware. Era apenas um modelo fundamental, embora o artigo incluísse exemplos de ajuste fino por instruções.

Meta informó que el modelo de 13B parámetros superó al mucho más grande GPT-3 (175B parámetros) en la mayoría de los benchmarks de PLN, y que el modelo más grande de 65B era competitivo con modelos de vanguardia como PaLM y Chinchilla.

Vazamento e Consequências

Em 3 de março de 2023, um torrent contendo os pesos do Llama foi enviado, com um link compartilhado no imageboard 4chan e posteriormente difundido através de comunidades de IA online. No mesmo dia, uma solicitação de pull no repositório oficial do Llama solicitava a adição do link magnético à documentação. Em 4 de março, outra solicitação de pull adicionava links a repositórios HuggingFace que hospedavam o modelo. Meta apresentó solicitudes de retirada em 6 de março, caracterizando a distribuição como não autorizada, e HuggingFace cumpriu. Em 20 de março, Meta apresentó uma solicitud de retirada DMCA contra um repositório que contenia um script para baixar Llama de um mirror, e GitHub cumpriu no dia seguinte.

As reações ao vazamento foram mistas. Alguns especularam que o modelo poderia ser usado para fins maliciosos, como spam mais sofisticado. Outros celebraram a acessibilidade, notando que versões menores podían ser executadas de forma relativamente barata, potencialmente fomentando mais pesquisa. Comentaristas como Simon Willison compararam Llama ao Stable Diffusion, um modelo texto-imagem distribuido abertamente que estimuló o desenvolvimento rápido de ferramentas, sugerindo um efeito semelhante para LLMs.

Llama 2

Em 18 de julho de 2023, em parceria com Microsoft, Meta anunció Llama 2, a próxima generación, com tamanhos de modelo de 7B, 13B e 70B parámetros. A arquitetura permaneció em gran medida inalterada em relação ao Llama 1, mas o treinamento utilizó 40% mais dados. Llama 2 incluía tanto modelos fundamentais como ajustados por chat, e todos os pesos foram lançados para muitos usos comerciales. No entanto, como a licença incluye uma política de uso aceptable, não é considerada código aberto pela Open Source Initiative, e o uso do termo por Meta tem sido disputado.

Code Llama, um ajuste fino de Llama 2 em conjuntos de dados específicos de código, foi lançado em versões: 7B, 13B e 34B em 24 de agosto de 2023, e uma versão 70B em 29 de janeiro de 2024. Os modelos fundamentais foram treinados em 500B tokens adicionais de dados de código, depois 20B tokens de dados de contexto longo, com ajuste fino adicional por instruções em 5B tokens. Um modelo específico para Python foi treinado em 100B tokens de código Python.

Llama 3

Em 18 de abril de 2024, Meta lançó Llama 3 em dois tamanhos: 8B e 70B parámetros. Os modelos foram pré-treinados em aproximadamente 15 trilhões de tokens de fontes disponíveis públicamente, com modelos de instrução ajustados em conjuntos de dados de instruções públicas e mais de 10 milhões de exemplos anotados por humanos. Os testes de Meta mostraram que Llama 3 70B superó Gemini Pro 1.5 e Claude 3 Sonnet na maioria dos benchmarks. Meta anunció planos para fazer Llama 3 multilíngue, multimodal, melhor em codificação e raciocinio, e aumentar sua janela de contexto.

Em relação às leis de escala, os modelos Llama 3 mostraram empiricamente que o desempeño continua escalando log-linearmente mesmo além da quantidade óptima de dados de treinamento de Chinchilla. Por exemplo, o conjunto de dados óptimo de Chinchilla para Llama 3 8B é de 200 bilhões de tokens, mas o desempeño melhoró até 15 trilhões de tokens (75 vezes más). Em uma entrevista, Mark Zuckerberg notó que a versión 8B era quase tão poderosa como a maior Llama 2, e que o modelo 70B ainda estava aprendendo ao final do treinamento, que foi interrompido para alocar recursos de GPU em outro lugar.

Llama 3.1 foi lançado em 23 de julho de 2024, introduciendo um modelo de 405B parámetros, juntamente com versões atualizadas de 8B e 70B, com uma janela de contexto mais longa de 128K tokens e melhor suporte multilíngue.

Llama 4 e Além

Llama 4 foi lançado em abril de 2025, apresentando uma arquitetura de mistura de expertos com tamanhos de até 2 trilhões de parámetros. Introdujo capacidades multimodales e melhor raciocinio. Em abril de 2026, Meta Superintelligence Labs lançó Muse Spark como um substituto para Llama, señalando uma mudança na estratégia de IA da Meta.

Impacto e Ecosistema

O vazamento dos pesos de Llama 1 catalizó um ecosistema vibrante de código aberto, com numerosos ajustes finos e derivados surgiendo. Permitió a pesquisadores e entusiastas experimentar com LLMs sem custos de API, levando a inovações em quantização, inferência eficiente e implementação local. A disponibilidade de modelos menores como 7B e 13B tornó viável executar LLMs em hardware de consumo, democratizando o acesso. Isso contrastó com as abordagens fechadas de outros grandes laboratorios como OpenAI e Anthropic, e influenció lançamentos posteriores de outras organizações. A controvérsia sobre licenciamento também destacó tensões entre ideales de código aberto e control corporativo, um debate que continua na comunidade de IA.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-models·meta-ai·open-source-software·ai-leak
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico