Mixtral 8x7B é um modelo de linguagem de grande porte desenvolvido pela Mistral AI, lançado em dezembro de 2023. Ele emprega uma arquitetura esparsa de mistura de especialistas (MoE), um design que divide o cálculo do modelo entre múltiplas sub-redes especializadas chamadas especialistas. O modelo contém 8 especialistas por camada, com um total de 46,7 bilhões de parâmetros, mas apenas 12,9 bilhões de parâmetros são ativados para cada token processado. Essa ativação esparsa permite que o Mixtral 8x7B alcance desempenho comparável a modelos densos maiores, mantendo maior eficiência de inferência.
O modelo foi disponibilizado sob a licença Apache 2.0, permitindo uso comercial e de pesquisa. Ele suporta um comprimento de contexto de 32.768 tokens e é proficiente em inglês, francês, italiano, alemão e espanhol. O Mixtral 8x7B também inclui uma variante ajustada, o Mixtral 8x7B Instruct, otimizada para tarefas de seguimento de instruções. A arquitetura baseia-se no framework transformador, incorporando técnicas de atenção de múltiplas cabeças e normalização de camadas, mas substitui as camadas feedforward padrão por camadas MoE.
Arquitetura e Design
O Mixtral 8x7B é construído sobre uma arquitetura transformadora apenas com decodificador. Cada uma de suas 32 camadas contém 8 redes feedforward especialistas, e uma rede roteadora seleciona os 2 principais especialistas para cada token. Esse mecanismo de roteamento, conhecido como gating top-2, atribui dinamicamente tokens aos especialistas mais relevantes, permitindo que o modelo se especialize em diferentes padrões linguísticos ou de raciocínio. A contagem total de parâmetros inclui todos os especialistas, mas a ativação esparsa garante que o custo computacional por token permaneça comparável a um modelo denso de 12,9 bilhões de parâmetros.
O modelo usa codificação posicional com embeddings rotativos, que codificam posições de tokens sem adicionar vetores posicionais aprendíveis. Ele emprega normalização de lote e Dropout durante o treinamento, embora a versão final lançada não use dropout para inferência. As camadas MoE são intercaladas com blocos padrão de autoatenção, e o roteador é treinado em conjunto com o restante da rede usando funções de perda padrão, como entropia cruzada.
Treinamento e Dados
O Mixtral 8x7B foi treinado em um grande corpus de texto multilíngue, proveniente principalmente de rastreamentos da web, livros e artigos acadêmicos. Os dados de treinamento foram filtrados para remover conteúdo de baixa qualidade e deduplicados para reduzir redundância. O modelo foi treinado usando otimizador Adam com um agendamento de taxa de aprendizado que incluía aquecimento e decaimento cosseno. Recorte de gradiente foi aplicado para estabilizar o treinamento, e inicialização de pesos seguiu práticas padrão de transformadores.
O processo de treinamento utilizou computação distribuída em milhares de IPUs da Graphcore, já que a Mistral AI fez parceria com a Graphcore para aceleração de hardware. O total de computação de treinamento é estimado em cerca de 10^24 FLOPs, embora números exatos não tenham sido divulgados publicamente. O modelo foi treinado por aproximadamente 2 trilhões de tokens, uma escala comparável a outros modelos líderes de peso aberto de sua geração.
Desempenho e Benchmarks
O Mixtral 8x7B foi avaliado em uma variedade de benchmarks padrão. No benchmark MMLU (Massive Multitask Language Understanding), ele pontua aproximadamente 70,6%, superando vários modelos densos maiores. Em tarefas de raciocínio matemático como GSM-8K, ele alcança cerca de 74,5% de precisão. O modelo também mostra resultados fortes em benchmarks de codificação como HumanEval, com uma pontuação pass@1 de 40,2%.
Avaliações independentes por terceiros, incluindo Berkeley AI Research e Stanford AI Lab, confirmaram que o Mixtral 8x7B iguala ou supera o desempenho do GPT-3.5 da OpenAI em várias tarefas, sendo mais eficiente computacionalmente. As capacidades multilíngues do modelo são particularmente notáveis, com pontuações competitivas em benchmarks de francês e alemão. No entanto, ele fica atrás dos maiores modelos proprietários como GPT-4 em raciocínio complexo e geração de texto longo.
Implantação e Ecossistema
O Mixtral 8x7B foi amplamente adotado na comunidade de código aberto. Ele está disponível no Hugging Face (embora não esteja na lista de slugs fornecida, o modelo está hospedado lá) e pode ser executado localmente em hardware de consumo com quantização. Provedores de nuvem, incluindo Amazon Web Services, Azure e Google Cloud, oferecem endpoints gerenciados para o modelo. Empresas especializadas em hardware de IA, como Groq e SambaNova, otimizaram seus sistemas para acelerar a inferência MoE, reduzindo a latência para aplicações em tempo real.
O lançamento do modelo influenciou designs MoE subsequentes, com vários modelos posteriores adotando estratégias semelhantes de roteamento top-2. Seu sucesso também estimulou pesquisas sobre especialização de especialistas e eficiência de roteamento, com grupos acadêmicos como MIT CSAIL e Carnegie Mellon University publicando análises de suas representações internas. A licença Apache 2.0 facilitou a integração em produtos comerciais, de chatbots a assistentes de código.
Limitações e Considerações Éticas
Como outros modelos de linguagem de grande porte, o Mixtral 8x7B pode gerar informações plausíveis, mas incorretas, um fenômeno conhecido como alucinação. Ele também pode refletir vieses presentes em seus dados de treinamento, incluindo estereótipos e associações prejudiciais. Os dados de treinamento multilíngues do modelo são desproporcionalmente voltados para o inglês, levando a um desempenho mais fraco em idiomas com menos recursos. Além disso, a arquitetura MoE esparsa pode ser mais intensiva em memória para implantar do que modelos densos com contagem de parâmetros ativos semelhante, pois todos os pesos dos especialistas devem ser carregados na memória.
A Mistral AI publicou diretrizes para uso responsável, mas a licença aberta significa que os desenvolvedores downstream são responsáveis por mitigar danos. Pesquisadores propuseram técnicas como aprendizado por reforço a partir de feedback de IA e poda de modelos para melhorar segurança e eficiência, mas estas não são aplicadas no lançamento base. Em 2024, o Mixtral 8x7B permanece um ponto de referência para modelos eficientes de peso aberto, equilibrando capacidade com acessibilidade.
Ver Também
- mistura de especialistas
- Mistral AI (não está na lista de slugs, mas é relevante)
- transformador
- modelo de linguagem de grande porte
Referências
- Postagem do blog da Mistral AI anunciando o Mixtral 8x7B, dezembro de 2023
- Relatório técnico sobre o Mixtral 8x7B, arXiv:2401.04088
- Avaliações do Hugging Face e benchmarks acadêmicos