Traducido del inglés

Qwen3 es una familia de modelos de lenguaje de gran tamaño desarrollados por Alibaba Cloud, lanzada en 2025. Incluye variantes densas y de mezcla de expertos con pesos abiertos, que aparecen en tablas de clasificación públicas.

Qwen3 es una familia de modelos de lenguaje de gran tamaño desarrollada por Alibaba Cloud. Lanzada en abril de 2025, la familia incluye arquitecturas densas y de mezcla de expertos (MoE), con recuentos de parámetros que van desde 0.6 mil millones hasta 235 mil millones. Los modelos se destacan por su disponibilidad de pesos abiertos y su sólido rendimiento en puntos de referencia públicos, apareciendo en clasificaciones de medios y de LLM. El lanzamiento incluyó 20 variantes en instantáneas de puntos de referencia, cubriendo diferentes tamaños y configuraciones.

La serie Qwen3 se basa en las familias de modelos Qwen y Qwen2 anteriores, que también fueron desarrolladas por Alibaba Cloud. Los modelos están diseñados para una variedad de tareas, incluyendo generación de texto, razonamiento y codificación. Soportan múltiples idiomas, con un enfoque particular en inglés y chino, reflejando la base de usuarios global y doméstica de Alibaba.

Arquitectura y Variantes

Los modelos Qwen3 utilizan una arquitectura Transformer (architecture), el estándar para modelos de lenguaje de gran tamaño modernos. La familia incluye modelos densos (donde todos los parámetros están activos para cada token) y modelos MoE (donde solo un subconjunto de parámetros se activa por token, mejorando la eficiencia). El modelo denso más grande tiene 32 mil millones de parámetros, mientras que el modelo MoE más grande tiene 235 mil millones de parámetros totales con 22 mil millones activados por token.

Las 20 variantes en instantáneas de puntos de referencia incluyen modelos con parámetros densos de 0.6B, 1.7B, 4B, 8B, 14B, 32B, y modelos MoE con configuraciones 30B-A3B, 57B-A14B, 235B-A22B (donde el segundo número indica parámetros activados). Cada tamaño está disponible en versiones base y ajustadas por instrucciones, con algunas que también tienen un modo de "pensamiento" que permite un razonamiento extendido antes de responder.

Entrenamiento y Características

Los modelos Qwen3 fueron entrenados en un gran corpus de datos de texto, aunque Alibaba Cloud no ha revelado el tamaño exacto del conjunto de datos. El proceso de entrenamiento utilizó técnicas estándar como el optimizador Adam y la programación de la tasa de aprendizaje. Los modelos incorporan características como atención de múltiples cabezas y codificación posicional, que son comunes en modelos de lenguaje basados en transformadores.

Una característica clave de Qwen3 es su modo de pensamiento híbrido. Los usuarios pueden alternar entre un modo de respuesta rápida y directa y un modo de pensamiento que genera pasos de razonamiento internos antes de producir la respuesta final. Esto es similar a los enfoques utilizados por otras familias de modelos como la serie o1 de OpenAI, aunque la implementación de Qwen3 es de código abierto.

Las versiones ajustadas por instrucciones fueron alineadas utilizando técnicas como RLHF (Aprendizaje por Refuerzo con Retroalimentación Humana) y ajuste fino supervisado. Los modelos también soportan muestreo top-p y escalado de temperatura para controlar la aleatoriedad de la salida.

Rendimiento y Puntos de Referencia

Los modelos Qwen3 han aparecido en clasificaciones públicas de LLM, incluyendo LMArena (anteriormente Chatbot Arena) y varios puntos de referencia académicos. El modelo más grande, Qwen3-235B-A22B, ha mostrado un rendimiento competitivo contra modelos cerrados líderes de OpenAI, Anthropic y Google DeepMind en tareas como matemáticas, codificación y conocimiento general.

En instantáneas de puntos de referencia, las 20 variantes cubren una gama de tamaños, permitiendo a los usuarios elegir un modelo que equilibre rendimiento y costo computacional. Los modelos más pequeños (0.6B a 8B) son adecuados para despliegue en el borde, mientras que los modelos más grandes requieren recursos sustanciales de GPU. Los modelos han sido probados en puntos de referencia estándar como MMLU, HumanEval y GSM8K, aunque las puntuaciones específicas varían según la variante.

Disponibilidad y Ecosistema

Los modelos Qwen3 se lanzan bajo una licencia abierta, permitiendo uso comercial y de investigación. Están disponibles para descarga en Hugging Face y otros repositorios de modelos. Alibaba Cloud también ofrece los modelos a través de su plataforma en la nube, con APIs para despliegue.

Los modelos están soportados por un ecosistema creciente de herramientas y bibliotecas, incluyendo vLLM y Ollama para inferencia local. Pueden ser ajustados finamente utilizando marcos como Hugging Face Transformers y PyTorch. La naturaleza de pesos abiertos ha llevado a adaptaciones comunitarias, incluyendo versiones cuantizadas que se ejecutan en hardware de consumo.

Recepción e Impacto

El lanzamiento de Qwen3 fue notable por su escala y apertura. En el momento del lanzamiento, era una de las familias de modelos de pesos abiertos más grandes disponibles, compitiendo con modelos de la serie Llama de Meta y Mistral AI. La inclusión de variantes MoE hizo que los modelos a gran escala fueran más accesibles, ya que requieren menos recursos computacionales durante la inferencia.

La cobertura mediática destacó el sólido rendimiento de Qwen3 en tareas de razonamiento y sus capacidades multilingües. Los modelos han sido utilizados en diversas aplicaciones, incluyendo chatbots, asistentes de código y herramientas educativas. Sin embargo, como con todos los modelos de lenguaje de gran tamaño, existen preocupaciones sobre posibles sesgos y uso indebido, que Alibaba Cloud ha abordado mediante ajuste fino de seguridad y pautas de uso.

A mediados de 2025, Qwen3 continúa siendo actualizado, con Alibaba Cloud lanzando parches y variantes adicionales. La familia de modelos representa una contribución significativa a la comunidad de IA de código abierto, proporcionando una alternativa de alto rendimiento a los sistemas propietarios.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·alibaba·open-source·transformer
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial