Lançamento do Mixtral 8x7B

Traduzido do inglês

Mixtral 8x7B é um modelo de linguagem grande de mistura esparsa de especialistas lançado pela Mistral AI em dezembro de 2023, com 46,7 bilhões de parâmetros totais e 12,9 bilhões ativos por token, superando modelos maiores em muitos benchmarks.

Mixtral 8x7B é um modelo de linguagem grande (LLM) de mistura esparsa de expertos (MoE) modelo de linguagem grande lançado pela Mistral AI em dezembro de 2023. Ele emprega uma arquitetura Transformer (architecture) somente-decodificador com 46,7 bilhões de parámetros totais, mas ativa apenas 12,9 bilhões de parámetros por token de entrada através de um mecanismo de roteamento que seleciona dois expertos de oito módulos feedforward em cada capa. Este design permite que o modelo alcance um desempeño comparável ou superior ao de modelos densos muito maiores, mantendo custos de inferência mais baixos. O lançamento incluiu tanto um modelo base como uma variante ajustada para seguir instruções, Mixtral 8x7B Instruct, com pesos disponibilizados publicamente sob uma licença Apache 2.0.

O modelo foi anunciado em 11 de dezembro de 2023, através de uma publicação de blog e um link de torrent, marcando um hito significativo no panorama de IA generativa de pesos abertos. Fue desenvolvido pela Mistral AI, uma startup com sede em París fundada em 2023 por ex-investigadores de OpenAI e Google DeepMind. O lançamento posicionou Mixtral 8x7B como um competidor direto de modelos proprietários como GPT-3.5 da OpenAI e Claude 2 de Anthropic, enquanto também desafiaba o domínio de modelos abertos de Meta e outros laboratorios. Sua arquitetura de mistura de expertos baseou-se em investigações anteriores sobre computação condicional, incluindo trabalho de Nokia Bell Labs e Google DeepMind, mas aplicada a uma escala nunca antes vista em lançamentos de código aberto.

Arquitectura e Design

Mixtral 8x7B usa uma capa MoE esparsa no lugar de cada rede feedforward padrão no transformer. Cada capa contém oito redes expertas, e uma rede de portão (frecuentemente um softmax sobre logits aprendidos) rotea cada token aos dois expertos principais. Esta activação esparsa reduz o custo computacional por token a aproximadamente o de um modelo denso de 12,9 bilhões de parámetros, enquanto a contagem total de 46,7 bilhões permite uma grande capacidade de conhecimento. O modelo usa uma janela de contexto de 32.768 tokens e suporta múltiples idiomas, incluindo inglês, francés, alemán, español e italiano.

O mecanismo de roteamento é treinado de extremo a extremo sem perdas auxiliares de balanceo de carga, dependendo da diferenciación natural para distribuir tokens entre expertos. Isto contrasta com sistemas MoE anteriores que requerían restricciones explícitas de balanceo. O modelo também incorpora atenção multi-cabeza com atenção de consulta agrupada, reduzindo o uso de memoria de cache de clave-valor durante a inferência. A arquitetura basea-se no marco Transformer (architecture) introducido em 2017, com modificações para computação esparsa e escalado eficiente.

Treinamento e Dados

Os detalhes do treinamento foram parcialmente divulgados no anúncio de lançamento. Mixtral 8x7B foi pré-treinado em dados provenientes de corpus web públicos, sem que se publicassem oficialmente cifras específicas de tamaño ou composição. O treinamento usou uma variante do optimizador Adam com uma agenda de taxa de aprendizagem coseno, e empregou recorte de gradiente e normalización de capa para estabilidad. A variante ajustada para instruções foi refinada adicionalmente usando ajuste fino supervisado em dados de demonstração e Reinforcement Learning from AI Feedback (RLAIF) (aprendizaje por refuerzo a partir de feedback de IA), uma técnica similar a RLHF pero que usa etiquetas de preferencia generadas por IA.

O modelo base foi treinado para predecir o seguinte token numa secuencia, usando uma función de perda de entropía cruzada estándar. O modelo de instruções foi optimizado para seguir prompts de usuário e produzir respostas úteis e seguras. Mistral AI não divulgou o número exato de tokens de treinamento, mas análises independentes sugeriron que o modelo foi treinado num corpus substancial, provavelmente superior a 1 trilhão de tokens, baseado no desempeño en benchmarks e na comparación com outros modelos de tamaño similar.

Desempeño e Benchmarks

Mixtral 8x7B demonstrou um desempeño sólido numa variedade de benchmarks estándar. No benchmark MMLU (compreensão de linguagem multitarea massiva), obtuvo aproximadamente 70,6% num contexto de 5 disparos, superando a GPT-3.5 e Llama 2 70B. No teste de razonamento de senso comum HellaSwag, alcanzó cerca de 86,7%, e na tarefa de resolución de coreferencias WinoGrande, obtuvo aproximadamente 81,2%. O modelo também se destacou em matemáticas e generación de código, com puntuaciones em GSM-8K (razonamiento matemático) ao redor de 74,5% e em HumanEval (compleción de código) ao redor de 40,2% para o modelo base, com a variante Instruct melhorando a 42,2%.

Em comparaciones directas, Mixtral 8x7B igualou ou superou o desempeño de Llama 2 70B na maioria das tarefas enquanto usava apenas cerca de um sexto dos parámetros activos durante a inferência. Também superou ao GPT-3.5, maior, em vários benchmarks, incluindo MMLU e HellaSwag. A eficiencia do modelo o fazia atractivo para implantação em dispositivos de borde e em ambientes sensibles ao custo, embora sua pegada total de memoria de aproximadamente 90 GB em FP16 ainda requería hardware substancial. O lançamento incluía uma versão quantizada (de 4 bits) que podía executarse em GPUs de consumo com 24 GB de VRAM.

Impacto e Recepción

O lançamento de Mixtral 8x7B foi amplamente coberto na comunidade de inteligência artificial e na prensa mainstream. Fue elogiado por democratizar o acesso a modelos de linguagem de alto desempeño, já que seus pesos abertos permitían a investigadores e desenvolvedores ajustar e implantar o modelo sem custos de API. O modelo também despertou um renovado interesse em arquitecturas MoE esparsas, influenciando lançamentos posteriores de outros laboratorios, incluindo o Qwen-MoE de Alibaba Cloud e o Jamba de AI21 Labs. Evaluaciones independentes notaron que Mixtral 8x7B exibía fortes capacidades multilingües e razonamiento robusto, embora alguns críticos apuntaran a posibles sesgos e limitaciones de segurança comuns em modelos abertos.

O lançamento coincidiu com uma tendência más ampla de modelos de pesos abertos desafiando sistemas proprietários. Fue seguido pelo Mixtral 8x22B, maior, da Mistral AI, em abril de 2024, que escalou a mesma arquitetura a 141 bilhões de parámetros totais. O éxito de Mixtral 8x7B contribuiu à valoración de Mistral AI, que alcanzó $6,2 bilhões numa ronda de financiamento anunciada em junho de 2024. O modelo também serviu como ponto de referencia para investigação em poda de modelos e aumento de datos, já que sua estrutura esparsa proporcionaba um banco de pruebas natural para técnicas de eficiencia.

Detalles Técnicos e Disponibilidade

Mixtral 8x7B foi lançado sob a licença Apache 2.0, permitindo uso comercial e modificación. Os pesos do modelo foram distribuidos via Hugging Face e um link BitTorrent, refletindo o compromiso da Mistral AI com o acesso aberto. O modelo base e a variante Instruct foram fornecidos em formatos FP16 e BF16, com quantizaciones criadas pela comunidade disponíveis para inferência de menor precisión. O modelo foi integrado em marcos de inferência principais, incluindo vLLM, TensorRT-LLM, e o hardware baseado em LPU de Groq, que alcanzaba latencias particularmente baixas devido à activación esparsa do modelo.

Para desenvolvedores, o modelo requería aproximadamente 90 GB de memoria GPU em FP16, ou cerca de 24 GB em quantización de 4 bits. Suportava uma longitud de contexto de 32.768 tokens, permitindo o processamento de documentos longos. O modelo de instruções foi optimizado para chat e compleción de tarefas, com um formato de prompt de sistema similar ao de outros modelos de chat. Mistral AI também proporcionaba uma API para acesso hospedado, mas os pesos abertos fazían viável a implantação local para muitas organizações. A documentação do lançamento incluía benchmarks, uma ficha técnica do modelo e código de exemplo, facilitando uma adopción rápida em industrias que van desde Amazon Web Services até Microsoft Azure e Google Cloud.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-model·mixture-of-experts·open-source-ai·machine-learning
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico