Traduzido do inglês

Llama 3 é uma família de modelos de linguagem de grande porte de pesos abertos lançada pela Meta AI em abril de 2024, disponível em tamanhos de 8B e 70B parâmetros, treinada em 15 trilhões de tokens, e projetada para uso tanto como modelo de fundação quanto ajustado por instruções.

Llama 3 é uma família de modelos de linguagem de grande escala desenvolvida pela Meta AI e lançada em 18 de abril de 2024. Faz parte da série Llama, que começou em fevereiro de 2023, e representa um avanço significativo no desempeño de modelos de peso aberto. O lançamento inicial incluiu dois tamanhos de modelo: 8 bilhões (8B) e 70 bilhões (70B) de parámetros, com versões tanto de fundação como ajustadas por instruções. Os modelos Llama 3 foram pré-treinados em aproximadamente 15 trilhões de tokens de texto de fontes públicas, com variantes ajustadas por instruções refinadas adicionalmente em conjuntos de dados de instruções públicas e mais de 10 milhões de exemplos anotados por humanos.

Llama 3 se basea nos princípios arquitetónicos de seus predecessores, mas introduce melhoras notables na escala dos dados de treinamento e no desempeño. Segundo os testes da Meta AI em abril de 2024, o modelo de 70B superou a modelos competidores como Gemini Pro 1.5 e Claude 3 Sonnet na maioria dos benchmarks. O lançamento também marcou a implementação de Meta AI, um assistente de IA construído sobre Llama, disponível através de um site dedicado e integrado em Facebook e WhatsApp.

Antecedentes

O desenvolvimento de Llama 3 ocorreu em um contexto de progresso rápido na IA generativa, especialmente após o lançamento de ChatGPT no final de 2022. O sucesso de ChatGPT intensificou o interesse em modelos de linguagem de grande escala, levando as empresas a investir fortemente em escalar e refinar esses sistemas. O principal cientista de IA da Meta, Yann LeCun, havia expressado anteriormente que os modelos de linguagem de grande escala são mais adequados para auxiliar na escrita, uma perspectiva que influenciou o diseño dos modelos Llama.

Llama 3 também reflete uma mudança na abordagem da Meta para a distribuição de modelos. Enquanto o Llama original estava restringido a pesquisadores acadêmicos sob uma licencia não comercial, versões subsequentes, incluindo Llama 3, foram acessibles a um público mais amplo sob licencias que permiten algum uso comercial. Esta abertura estimulou a inovação, mas também levantou debates sobre a definição de "código aberto" na comunidade de IA.

Arquitectura e Treinamento

Os modelos Llama 3 usam uma arquitectura Transformer (architecture) padrão, similar às versões anteriores de Llama, mas com melhoras na metodología de treinamento. Os modelos foram treinados em um conjunto de dados de 15 trilhões de tokens, um aumento substancial em comparação com os 1,4 trilhões de tokens usados para Llama 2. Esta escala permitiu que os modelos alcanzassem um desempeño melhor em uma amplia gama de tarefas.

Um hallazgo clave do treinamento de Llama 3 esteve relacionado com as leis de escalado. Os modelos demonstraron empíricamente que o desempeño continua melhorando log-linearmente mesmo quando os dados de treinamento excedem a quantidade "óptima de Chinchilla". Por exemplo, o conjunto de datos óptimo de Chinchilla para o modelo de 8B é de 200 bilhões de tokens, mas o desempeño continuou escalando até os 15 trilhões de tokens usados, que é 75 vezes maior. Esta observação tem implicações para futuras estratégias de treinamento de modelos.

Durante uma entrevista com Dwarkesh Patel, o CEO da Meta, Mark Zuckerberg, notou que a versão de 8B de Llama 3 era quase tão poderosa como o maior modelo de Llama 2. Ele também mencionou que o modelo de 70B ainda estava aprendendo no final de seu treinamento de 15 trilhões de tokens, mas a decisão foi tomada de parar o treinamento para alocar recursos de GPU em outro lugar.

Desempeño e Benchmarks

Os modelos Llama 3 alcanzaron resultados de última generación em muitos benchmarks de processamento de linguagem natural no momento do lançamento. O modelo de 70B, em particular, superó a vários modelos proprietários, incluindo Gemini Pro 1.5 e Claude 3 Sonnet, em tarefas como raciocinio, codificación e conhecimento geral. O modelo de 8B, a pesar de seu menor tamaño, ofereceu um desempeño competitivo, tornándolo adecuado para implementação em hardware menos potente.

A avaliação da Meta AI mostrou que Llama 3 70B se destacó em áreas como raciocinio matemático e generación de código, enquanto o modelo de 8B ofereceu um equilíbrio sólido entre eficiencia e capacidade. Estes resultados posicionaron a Llama 3 como um modelo de peso aberto líder, desafiando a dominância dos sistemas de código cerrado.

Disponibilidade e Ecosistema

Llama 3 foi lançado sob uma licencia que permite o uso comercial, com uma política de uso aceptable que restringe certas aplicações. Os modelos estão disponíveis para descarga desde o site da Meta e através de várias plataformas de nube, incluindo Amazon Web Services, Azure e Google Cloud. Esta acessibilidade facilitou a adoção generalizada em pesquisa e indústria.

O lançamento de Llama 3 também coincidiu com o lançamento de Meta AI, um assistente que aproveita as capacidades do modelo. Meta AI está integrado em Facebook, WhatsApp e um site dedicado, proporcionando aos usuários serviços de IA conversacional. O ecosistema ao redor de Llama 3 incluye herramientas para fine-tuning, quantización e implementación, permitiendo aos desenvolvedores personalizar os modelos para casos de uso específicos.

Legado e Futuro

Llama 3 marcou um hito na evolución dos modelos de linguagem de grande escala de peso aberto, demonstrando que tais modelos podían rivalizar com contrapartes proprietárias. Seu sucesso influyó em desenvolvimentos subsequentes, incluindo Llama 3.1 lançado em 23 de julho de 2024, que introdujo melhoras adicionais. A série Llama continuó com Llama 4 em abril de 2025, e em abril de 2026, Meta Superintelligence Labs lançó Muse Spark como um reemplazo para Llama.

O impacto de Llama 3 se extiende más allá dos logros técnicos, já que contribuyó a discussões sobre segurança de IA, acessibilidade e democratización de tecnologías avançadas de IA. Su natureza de peso aberto permitiu a pesquisadores e desenvolvedores de todo o mundo experimentar e construir sobre o modelo, fomentando um ecosistema vibrante de inovação.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-models·meta-ai·open-source-ai·generative-ai
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico