英語からの翻訳

gpt-6-astra-maxは、OpenAIによる大規模言語モデルであり、2026年にリリースされ、2026年9月時点でLMArenaやLiveBenchなどの公開ベンチマークリーダーボードにランクインしている。

gpt-6-astra-maxは、OpenAIによって開発された大規模言語モデルであり、2026年に初めてリリースされた。2026年9月12日付の最新スナップショット時点で、会話能力、推論、コーディング性能を評価するLMArenaやLiveBenchを含む公開ベンチマークのリーダーボードでトップの位置を占めている。このモデルは、OpenAIのGPTシリーズの第6世代を代表し、汎用生成AIアプリケーション向けのフラッグシップシステムとして位置づけられている。

このモデルは、トランスフォーマーアーキテクチャに基づいており、マルチヘッドアテンションクロスアテンション機構の進歩を組み込んでいる。トレーニングには、公開ウェブテキスト、ライセンス済みコーパス、出版社との提携による独自データを混在させた、15兆トークン以上のデータセットが使用された。トレーニング実行には約100,000基のAMD MI300Xアクセラレータが使用され、これはNVIDIAハードウェアに依存していた初期のOpenAIモデルからの転換点となった。最終トレーニング実行の計算予算は3.2エクサフロップス日と推定され、この数字はOpenAIの技術レポートで開示された。

アーキテクチャとトレーニング

このモデルは1.8兆パラメータを有し、トークンあたり3200億パラメータを活性化するスパース混合エキスパート設計を採用している。このアーキテクチャにより、高い容量を維持しながら効率的な推論が可能となる。コンテキストウィンドウは200万トークンで、長文ドキュメントやマルチターン会話の処理を可能にする。トレーニングでは、教師あり微調整の初期段階に続いて、AIフィードバックからの強化学習が事後トレーニングの整合ステップとして採用された。トレーニングパイプラインでは、5,000ステップのウォームアップフェーズと120万ステップにわたるコサイン減衰を含むカスタム学習率スケジュールを備えたAdamオプティマイザも使用された。

トレーニングデータはドメインのバランスを取るようにキュレーションされ、ウェブテキスト40%、書籍と学術論文25%、GitHubなどのリポジトリからのコード20%、120言語をカバーする多言語コンテンツ15%で構成された。重複排除により、生コーパスは18%削減された。モデルは2段階でトレーニングされ、180日間の事前トレーニングフェーズと、それに続く45日間の指示チューニングフェーズが行われた。

ベンチマークとパフォーマンス

LMArenaリーダーボードでは、gpt-6-astra-maxは2026年9月12日時点でEloレーティング1,482を達成し、前リーダーであるAnthropicのClaude 5.2を37ポイント上回った。LiveBenchでは、コーディングスイートで91.4%、数学的推論で88.7%、多言語タスクで84.2%をスコアした。MMLU-Proベンチマークでは93.1%に達し、前モデルGPT-5.5から2.3ポイントの改善となった。スタンフォードAIラボバークレーAIリサーチによる独立評価はこれらの結果を確認したが、トレーニングにウェブデータが含まれるため、ベンチマーク汚染の潜在的なリスクを指摘した。

このモデルは長文コンテキストタスクでも強力なパフォーマンスを示し、100万トークン検索ベンチマークRULERで98.2%の精度を達成した。エージェントタスクでは、外部ツールなしでGAIAベンチマークのタスクの87%を完了し、GPT-5.5の71%から向上した。

展開と可用性

OpenAIは、gpt-6-astra-maxをAPIおよびChatGPT PlusやEnterpriseを含む消費者向け製品を通じて提供している。このモデルは、Microsoft (AI)との提携を通じてAzureで利用可能であり、Amazon Web ServicesではSageMakerを通じて提供される。また、低遅延推論のためにGroqハードウェアでも提供され、100トークンのプロンプトに対する初回トークンまでの時間は0.4秒と報告されている。価格は入力トークン100万あたり3.50ドル、出力トークン100万あたり12.00ドルに設定されており、GPT-5.5と比較して20%の削減となっている。

このモデルは、テキスト、画像、音声を含むマルチモーダル入力をサポートするが、出力はテキストのみである。残差ネットワークの変種に基づくビジョンエンコーダが、448x448解像度の画像を処理する。音声入力には、波形処理用のU-Netスタイルのエンコーダが使用される。

受容と影響

MIT CSAILオックスフォード大学の研究者からの初期レビューは、モデルの推論の深さと幻覚率の低減を賞賛した。OpenAIは内部の事実整合性テストで幻覚率を2.1%と報告している。しかし、メラニー・ミッチェルを含む一部の批評家は、420,000 MWhと推定されるトレーニングの環境コストと、モデルがベンチマークパターンに過適合する傾向について懸念を表明した。このリリースはまた、AI安全性に関する議論を引き起こし、OpenAIは150人の外部研究者によるレッドチーミング結果を詳述したシステムカードを公開した。

エンタープライズ分野では、インテュイティブ・サージカルTomTomなどの企業が、医療文書化とナビゲーション精度の改善を挙げて、このモデルを製品に統合している。Oracle CloudGoogle Cloudへの展開により、HIPAAおよびSOC 2 Type IIのコンプライアンス認証を取得し、規制産業へのリーチが拡大した。

今後の方向性

OpenAIは、gpt-6-astra-maxが定期的に更新され、2027年初頭にマイナーバージョンリリースが計画されていることを示している。推論コストを削減するためのモデルプルーニングデータ拡張に関する研究が進行中である。同社はまた、次世代向けにカスタムシリコンを開発するためのTSMCとの協力を発表し、トレーニング時間を30%削減すると期待されている。最新のスナップショット時点では後継機は発表されていないが、内部レポートはマルチモーダル生成とリアルタイム推論の改善に焦点を当てていることを示唆している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-model·openai·generative-ai·benchmarks
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴