Traduzido do inglês

Qwen3 A22B é uma família de modelos de linguagem de grande porte da Alibaba, com quatro variantes que aparecem em rankings públicos de LLM/mídia. É um modelo MoE denso com 22 bilhões de parâmetros no total.

Qwen3 A22B é uma família de modelos de linguagem de grande porte desenvolvida pela Alibaba Cloud, lançada pela primeira vez em abril de 2025. A família inclui quatro variantes que apareceram em rankings públicos de LLM e mídia, incluindo a plataforma de benchmarking de IA Artificial Analysis e o ranking LMArena. Os modelos são baseados em uma arquitetura de mistura de especialistas (MoE), com 22 bilhões de parâmetros totais e aproximadamente 3 bilhões de parâmetros ativos por token. A família faz parte da série mais ampla Qwen3, que também inclui modelos densos de vários tamanhos.

Os modelos Qwen3 A22B são projetados para tarefas de raciocínio e não raciocínio, suportando um comprimento de contexto de 256.000 tokens. Eles são lançados sob uma licença de código aberto, especificamente a licença Apache 2.0, permitindo uso comercial. Os modelos estão disponíveis em variantes base e ajustadas por instruções, com as versões ajustadas por instruções otimizadas para aplicações de chat e agênticas.

Arquitetura e Treinamento

O Qwen3 A22B usa uma arquitetura MoE baseada em transformadores, incorporando técnicas como atenção de múltiplas cabeças, conexões residuais e normalização de camadas. O modelo emprega um tokenizador com um tamanho de vocabulário de 151.936 e usa amostragem top-p e escalonamento de temperatura durante a geração. O treinamento envolveu um processo em duas etapas: pré-treinamento inicial em um grande corpus de texto multilíngue, seguido por ajuste fino supervisionado e aprendizado por reforço a partir de feedback de IA (RLAIF) para alinhar com preferências humanas.

O modelo foi treinado em uma mistura de dados da web, livros e código, com foco em inglês e chinês. O poder computacional de treinamento é estimado em vários milhares de dias de GPU, embora números exatos não sejam divulgados publicamente. O modelo usa otimizador Adam com um agendamento de taxa de aprendizado cosseno e recorte de gradiente para estabilidade.

Desempenho em Benchmarks

Em rankings públicos, a variante ajustada por instruções do Qwen3 A22B demonstrou desempenho competitivo. Em maio de 2025, classificou-se entre os principais modelos de peso aberto no ranking LMArena, com uma classificação Elo de aproximadamente 1300, colocando-o acima de muitos modelos proprietários maiores. No Índice de Inteligência Artificial Analysis, obteve 46 pontos, superando modelos como GPT-4o-mini e Claude 3.5 Haiku. Em benchmarks padrão, alcançou 83,2% no MMLU-Pro, 86,1% no GPQA-Diamond e 91,1% no AIME 2025, indicando fortes capacidades de raciocínio e matemática.

A variante base também teve bom desempenho em benchmarks de codificação, pontuando 72,6% no LiveCodeBench e 65,4% no SWE-bench Verified. Esses resultados foram citados em relatórios de mídia e avaliações acadêmicas, embora a replicação independente esteja em andamento.

Variantes e Disponibilidade

A família Qwen3 A22B inclui quatro variantes: Qwen3-22B (base), Qwen3-22B-Instruct, Qwen3-22B-Instruct-2507 e Qwen3-22B-Instruct-2507-AWQ. As versões 2507, lançadas em julho de 2025, incluem atualizações no ajuste de instruções e suporte para chamada de ferramentas. A variante AWQ é quantizada para inferência eficiente, usando pesos de 4 bits. Todas as variantes estão disponíveis para download via Hugging Face e ModelScope, e são integradas às ofertas de Amazon SageMaker, Azure AI e Google Cloud.

Recepção e Impacto

O lançamento do Qwen3 A22B foi notável por sua abordagem de peso aberto, permitindo que pesquisadores e desenvolvedores executem o modelo em hardware de consumo com aceleradores Groq ou SambaNova. Ele tem sido usado em várias aplicações, incluindo chatbots de IA generativa e assistentes de codificação. O desempenho do modelo foi comparado favoravelmente ao GPT-4.1 da OpenAI e ao Claude 3.5 Sonnet da Anthropic, particularmente em tarefas de raciocínio. No entanto, algumas avaliações observam que as capacidades multilíngues do modelo são menos robustas para idiomas não ingleses além do chinês.

Até o final de 2025, a família Qwen3 A22B continua sendo uma escolha popular para implantação local, com uma forte comunidade de seguidores. Seu lançamento contribuiu para a tendência de modelos de peso aberto fechando a lacuna com sistemas proprietários.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-models·alibaba·open-source-ai·transformer-models
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico