Traduzido do inglês

Qwen1.5 é uma família de modelos de linguagem de grande porte desenvolvida pela Alibaba Cloud, lançada no início de 2024, disponível em múltiplos tamanhos de parâmetros e variantes, incluindo versões de código aberto e proprietárias.

Qwen1.5 é uma família de modelos de linguagem de grande porte desenvolvida pela Alibaba Cloud, lançada no início de 2024. A família inclui múltiplos tamanhos de parâmetros, variando de 0,5 bilhão a 72 bilhões de parâmetros, com variantes tanto base quanto ajustadas por instruções. Os modelos Qwen1.5 são projetados para uma variedade de tarefas de processamento de linguagem natural, incluindo geração de texto, tradução e resposta a perguntas, e apareceram em rankings públicos de LLM e de mídia, com sete variantes capturadas em instantâneos de benchmarks.

Os modelos são construídos sobre a arquitetura Transformer (architecture), um tipo de rede neural que se tornou padrão no desenvolvimento de modelos de linguagem de grande porte. Eles são treinados usando técnicas de aprendizado profundo, aproveitando conjuntos de dados em grande escala e recursos computacionais. Qwen1.5 faz parte da tendência mais ampla de IA generativa, onde modelos geram texto semelhante ao humano com base em prompts de entrada.

Variantes e Tamanhos de Modelo

Qwen1.5 inclui várias configurações de parâmetros: 0,5B, 1,8B, 4B, 7B, 14B, 32B e 72B. Cada tamanho está disponível em versões base (pré-treinada) e chat (ajustada por instruções). A variante de 72B é a maior e tipicamente demonstra desempenho superior em tarefas complexas, enquanto as variantes menores são otimizadas para eficiência e implantação em dispositivos com recursos limitados. Os modelos são lançados sob uma licença de código aberto, permitindo que pesquisadores e desenvolvedores os usem e modifiquem, com algumas restrições para uso comercial em aplicações de maior escala.

Treinamento e Arquitetura

Os modelos Qwen1.5 empregam uma arquitetura transformer padrão somente decodificador, semelhante a outros LLMs modernos. Eles usam mecanismos de atenção multi-cabeça e codificação posicional para processar dados sequenciais. O treinamento envolve técnicas de otimizador Adam e agendamento de taxa de aprendizado, com recorte de gradiente para estabilizar o treinamento. Os modelos são treinados em um corpus diversificado de dados de texto, embora detalhes específicos sobre o conjunto de dados de treinamento não sejam totalmente públicos. As variantes ajustadas por instruções são refinadas usando técnicas como Reinforcement Learning from AI Feedback (RLAIF) (aprendizado por reforço a partir de feedback de IA) e ajuste fino supervisionado para alinhar com a intenção do usuário.

Desempenho e Benchmarks

Os modelos Qwen1.5 foram avaliados em vários benchmarks, incluindo tarefas de compreensão de linguagem, raciocínio e codificação. Eles apareceram em rankings públicos, como o Open LLM Leaderboard, onde se classificaram de forma competitiva entre outros modelos de código aberto. A variante de 72B, em particular, mostrou desempenho forte, frequentemente comparável a modelos proprietários maiores. No entanto, as pontuações exatas de benchmark variam por tarefa e estão sujeitas a mudanças conforme novas avaliações são conduzidas.

Disponibilidade e Implantação

Qwen1.5 está disponível por meio de vários canais. As versões de código aberto podem ser baixadas de repositórios de modelos como Hugging Face, e estão integradas aos serviços da Alibaba Cloud, incluindo a API DashScope. Os modelos podem ser implantados em várias plataformas, incluindo Amazon Web Services, Azure e Google Cloud, bem como em hardware especializado como AWS Trainium e Groq para aceleração de inferência. Essa flexibilidade torna o Qwen1.5 acessível tanto para uso em pesquisa quanto em produção.

Recepção e Impacto

Qwen1.5 foi bem recebido na comunidade de IA por sua relação desempenho-tamanho, particularmente as variantes menores que oferecem resultados competitivos com requisitos computacionais mais baixos. Contribuiu para a proliferação de LLMs de código aberto, permitindo acesso mais amplo a capacidades avançadas de IA. A família de modelos também foi usada em pesquisa acadêmica e aplicações industriais, consolidando ainda mais seu papel no cenário em evolução da inteligência artificial.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-models·alibaba·open-source-ai·generative-ai
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico