Aus dem Englischen übersetzt

Qwen (Tongyi Qianwen) ist eine Familie von überwiegend offen gewichteten großen und kleinen Sprachmodellen von Alibaba Cloud, die erstmals im April 2023 als Beta-Version veröffentlicht wurde und für ihre großzügigen Lizenzen und die breite Nutzung in der Community bekannt ist.

Qwen (auch bekannt als Tongyi Qianwen, chinesisch: 通义千问; Pinyin: Tōngyì Qiānwèn) ist eine Familie überwiegend offener großer und kleiner Sprachmodelle (LLM und SLM), die von Alibaba Cloud entwickelt wurde. Die Serie umfasst dichte und Mixture-of-Experts-Architekturen, die von kleinen Modellen für Edge-Geräte bis zu großskaligen Modellen mit Billionen von Parametern reichen. Qwen-Modelle werden in der Open-Source-Community häufig als Grundlage für Fine-Tuning und Abliteration verwendet, und eine lokale Version unterstützt Apple Intelligence in China.

Die erste Iteration, die auf der Llama-1-Architektur von Meta AI basierte, wurde im April 2023 als Beta gestartet und veröffentlichte ihre 72B-Gewichte im Dezember 2023. Nachfolgende Versionen, Qwen2 und Qwen3, erweiterten die Familie um visuelle, audio- und omnimodale Fähigkeiten und führten reasoning-orientierte Modelle ein. Die neueste Veröffentlichung, Qwen3.8, umfasst das 2,4-Billionen-Parameter-Modell Qwen3.8-Max, das zum 12. August 2026 das zweitgrößte und zweitstärkste offene LLM und chinesische LLM nach Kimi K3 war.

Modellarchitektur und Training

Qwen-Modelle basieren auf der Transformer-Architektur und übernahmen zunächst das Llama-Design von Meta AI. Spätere Versionen integrieren Innovationen wie Multi-Head-Attention, sparse Mixture-of-Experts (MoE)-Schichten und lange Kontextfenster. Beispielsweise verwendet Qwen3.8-Max eine sparse MoE-Architektur mit etwa 95 Milliarden aktiven Parametern pro Vorwärtsdurchlauf und unterstützt ein Kontextfenster von bis zu einer Million Tokens. Die Trainingsdaten für Qwen3 umfassten 36 Billionen Tokens in 119 Sprachen und Dialekten, was breite mehrsprachige Fähigkeiten ermöglicht.

Die Familie umfasst sowohl dichte Modelle (z. B. Qwen3-dichte Varianten von 0,6B bis 32B Parametern) als auch MoE-Modelle (z. B. Qwen3-30B-A3B und Qwen3-235B-A22B). Qwen3.8-Max mit 2,4 Billionen Gesamtparametern ist das größte offene Modell der Serie. Die Modelle werden mit standardmäßigen Deep-Learning-Techniken trainiert, einschließlich Adam-Optimierung und Learning-Rate-Scheduling, obwohl spezifische Trainingsdetails oft nicht vollständig offengelegt werden.

Modellvarianten und Fähigkeiten

Qwen umfasst mehrere spezialisierte Modelllinien. Die Qwen-VL-Serie kombiniert einen Vision-Transformer mit einem LLM für visuelle Sprachaufgaben, mit Varianten wie Qwen2-VL (2B und 7B) und Qwen2.5-VL (3B, 7B, 32B, 72B). Qwen2.5-Omni-7B akzeptiert Text, Bilder, Videos und Audio als Eingabe und erzeugt sowohl Text- als auch Audioausgabe, was Echtzeit-Sprachinteraktion ermöglicht. Qwen-Audio verarbeitet Audioaufgaben, und Qwen2-Math konzentriert sich auf mathematisches Reasoning. Die QwQ-Serie, beginnend mit QwQ-32B-Preview im November 2024, betont Reasoning ähnlich wie OpenAIs o1, mit einer Kontextlänge von 32K Tokens.

Qwen3 führte einen Denkmodus ein, der ein- oder ausgeschaltet werden kann, sodass das Modell vor der Antwort nachdenken oder direkt antworten kann. Qwen3.8-Max, veröffentlicht als offene Gewichte am 12. August 2026, lässt bestimmte Cloud-Funktionen wie Bildeingabe und Nicht-Denkmodus aus, aber das destillierte Qwen3.8-27B enthält diese Funktionen und ist unter der permissiven Apache-Lizenz lizenziert.

Veröffentlichungen und Lizenzierung

Alibaba hat über 100 Modelle mit offenen Gewichten veröffentlicht, mit kumulativen Downloads von über 40 Millionen bis Anfang 2025. Die Lizenzierung variiert je nach Modell: Viele kleinere und destillierte Versionen verwenden die Apache-2.0-Lizenz, während größere Modelle oft eine Umsatzbeteiligungsvereinbarung für Anbieter erfordern, die mehr als 50 Millionen US-Dollar jährlich generieren. Beispielsweise erfordert Qwen3.8-2.4T-A95B eine solche kommerzielle Lizenz, während Qwen3.8-27B unter Apache 2.0 steht. Diese Strategie balanciert Offenheit mit kommerziellen Interessen aus und macht Qwen zu einem häufigen Ausgangspunkt für Community-Fine-Tuning.

Wichtige Veröffentlichungsdaten umfassen: Qwen-Beta im April 2023; Qwen-7B-Gewichte im August 2023; Qwen-72B und 1.8B im Dezember 2023; Qwen2 im Juni 2024; Qwen2.5-VL im Januar 2025; Qwen2.5-Max am 29. Januar 2025; Qwen2.5-VL-32B-Instruct am 24. März 2025; Qwen2.5-Omni-7B am 26. März 2025; Qwen3 am 28. April 2025; Qwen3.5 im Februar 2026; Qwen3.8-Max-Vorschau im Juli 2026; Cloud-Veröffentlichung am 3. August 2026; offene Gewichte am 12. August 2026; und Qwen3.8-27B am 14. August 2026.

Ökosystem und Anwendungen

Qwen-Modelle sind in Alibabas Cloud-Dienste und Verbraucheranwendungen integriert. Die Qwen-Mobil-App, aktualisiert im Januar 2026, verbindet sich mit Alibabas Ökosystem, beginnend mit Lebensmittellieferdiensten, mit Plänen zur Erweiterung auf Plattformen wie Taobao und Fliggy. Eine lokale Version von Qwen wird von Apple Intelligence in China verwendet und ist in das Betriebssystem integriert. Die Accio-Anwendung, gestartet im November 2024, nutzt Qwen für KI-gestützte Einkaufsassistenz.

In der Open-Source-Community haben Qwens permissive Lizenzen zu zahlreichen feinabgestimmten und abliterierten Derivaten geführt, wie "Liberated Qwen" von Abacus AI, das Inhaltsbeschränkungen entfernt, und "Qwable", das Tuning-Daten von Anthropics Fable 5 integriert. Diese Derivate unterstreichen Qwens Rolle als grundlegendes Modell für Experimente.

Aktuelle Entwicklungen

Im März 2026 trat Lin Junyang, ehemaliger Leiter der Qwen-KI-Modellabteilung, nach der Veröffentlichung von Qwen3.5 und Qwen3.5-Plus zurück und wurde damit der dritte Führungskraft, der Alibaba in diesem Jahr verließ. Alibaba bekräftigte sein Engagement für Open-Source-KI trotz dieser Abgänge. Später in diesem Monat offenbarte eine Unternehmensankündigung die Gründung einer neuen Einheit, obwohl Details bis Anfang 2026 begrenzt bleiben. Die Qwen3.8-Serie, einschließlich des proprietären Qwen3.8-Max und des offenen Qwen3.8-27B, stellt den neuesten Fortschritt dar, wobei Alibaba weiterhin die Grenzen von Umfang und Fähigkeit offener Modelle erweitert.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:large-language-models·alibaba·open-source-ai·generative-ai
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte