英語からの翻訳

Qwen3は、2025年にリリースされた、Alibaba Cloudによって開発された大規模言語モデルのファミリーである。高密度モデルと混合専門家モデルの両方のバリエーションを含み、オープンウェイトで公開されており、公開リーダーボードに登場している。

Qwen3は、大規模言語モデルのファミリーであり、Alibaba Cloudによって開発された。2025年4月にリリースされ、このファミリーには高密度モデルと混合専門家(MoE)アーキテクチャの両方が含まれ、パラメータ数は0.6億から2350億の範囲に及ぶ。これらのモデルは、オープンウェイトでの利用可能性と公開ベンチマークでの高い性能で注目され、メディアやLLMリーダーボードに登場している。リリースには、異なるサイズと構成をカバーする20のバリアントがベンチマークスナップショットに含まれていた。

Qwen3シリーズは、Alibaba Cloudによって開発された以前のQwenおよびQwen2モデルファミリーに基づいている。これらのモデルは、テキスト生成、推論、コーディングなど、さまざまなタスク向けに設計されている。複数の言語をサポートしており、特に英語と中国語に重点を置いており、Alibabaのグローバルおよび国内ユーザーベースを反映している。

アーキテクチャとバリアント

Qwen3モデルは、現代の大規模言語モデルの標準であるTransformer (architecture)アーキテクチャを使用している。このファミリーには、高密度モデル(すべてのパラメータが各トークンに対してアクティブ)とMoEモデル(各トークンに対してパラメータのサブセットのみがアクティブ化され、効率が向上)が含まれる。最大の高密度モデルは320億パラメータを持ち、最大のMoEモデルは合計2350億パラメータで、トークンごとに220億がアクティブ化される。

ベンチマークスナップショットの20のバリアントには、0.6B、1.7B、4B、8B、14B、32Bの高密度パラメータモデルと、30B-A3B、57B-A14B、235B-A22B構成(2番目の数字はアクティブ化されたパラメータを示す)のMoEモデルが含まれる。各サイズは、ベース版と命令調整版で利用可能であり、一部には回答前に拡張推論を可能にする「思考」モードもある。

トレーニングと機能

Qwen3モデルは、大規模なテキストデータコーパスでトレーニングされたが、Alibaba Cloudは正確なデータセットサイズを開示していない。トレーニングプロセスでは、Adamオプティマイザー学習率スケジューリングなどの標準的な技術が使用された。モデルには、トランスフォーマーベースの言語モデルで一般的なマルチヘッドアテンション位置エンコーディングなどの機能が組み込まれている。

Qwen3の主な特徴は、ハイブリッド思考モードである。ユーザーは、高速で直接的な応答モードと、最終回答を生成する前に内部推論ステップを生成する思考モードを切り替えることができる。これは、OpenAIのo1シリーズなどの他のモデルファミリーで使用されるアプローチと似ているが、Qwen3の実装はオープンソースである。

命令調整版は、RLHF(人間のフィードバックからの強化学習)や教師あり微調整などの技術を使用して調整された。モデルはまた、出力のランダム性を制御するためのtop-pサンプリング温度スケーリングもサポートしている。

パフォーマンスとベンチマーク

Qwen3モデルは、LMArena(旧Chatbot Arena)やさまざまな学術ベンチマークを含む公開LLMリーダーボードに登場している。最大のモデルであるQwen3-235B-A22Bは、数学、コーディング、一般知識などのタスクで、OpenAIAnthropicGoogle DeepMindの主要なクローズドモデルに対して競争力のあるパフォーマンスを示している。

ベンチマークスナップショットでは、20のバリアントがさまざまなサイズをカバーしており、ユーザーはパフォーマンスと計算コストのバランスを取るモデルを選択できる。小規模モデル(0.6Bから8B)はエッジ展開に適しており、大規模モデルはかなりのGPUリソースを必要とする。モデルは、MMLU、HumanEval、GSM8Kなどの標準ベンチマークでテストされているが、具体的なスコアはバリアントによって異なる。

可用性とエコシステム

Qwen3モデルはオープンライセンスでリリースされており、商用および研究用途が可能である。Hugging Faceや他のモデルリポジトリからダウンロードできる。Alibaba Cloudはまた、クラウドプラットフォームを通じてモデルを提供し、デプロイ用のAPIを提供している。

モデルは、vLLMやOllamaなどのローカル推論用ツールやライブラリの成長するエコシステムによってサポートされている。Hugging Face TransformersやPyTorchなどのフレームワークを使用して微調整できる。オープンウェイトの性質により、コンシューマーハードウェアで実行される量子化バージョンを含むコミュニティ適応が行われている。

受容と影響

Qwen3のリリースは、その規模と開放性で注目された。リリース時点では、MetaのLlamaシリーズやMistral AIのモデルと競合する、最大のオープンウェイトモデルファミリーの1つであった。MoEバリアントの組み込みにより、推論中の計算リソースが少なくて済むため、大規模モデルがよりアクセスしやすくなった。

メディアの報道では、Qwen3の推論タスクでの高い性能と多言語能力が強調された。モデルは、チャットボット、コードアシスタント、教育ツールなど、さまざまなアプリケーションで使用されている。ただし、すべての大規模言語モデルと同様に、潜在的なバイアスや誤用に関する懸念があり、Alibaba Cloudは安全性の微調整と使用ガイドラインを通じてこれに対処している。

2025年半ばの時点で、Qwen3は引き続き更新されており、Alibaba Cloudはパッチや追加のバリアントをリリースしている。このモデルファミリーは、オープンソースAIコミュニティへの重要な貢献を表しており、プロプライエタリなシステムに代わる高性能な選択肢を提供している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-model·alibaba·open-source·transformer
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴