# クロード・オーパス4-6ハイ

英語からの翻訳

Claude Opus 4.6 Highは、Anthropicが2026年にリリースした大規模言語モデルであり、2026年9月時点でLMArenaやLiveBenchなどの公開ベンチマークで上位にランクされている。

Claude Opus 4.6 Highは、Anthropicによって開発された大規模言語モデルであり、Opusシリーズの一環として2026年にリリースされた。複雑な推論、コーディング、長文脈タスク向けに設計されており、LMArenaやLiveBenchなどの公開ベンチマークのリーダーボードで上位にランクインしている。このモデルは、AnthropicのスケーラブルなAIシステムへのアプローチの洗練を表しており、信頼性と整合性に焦点を当てている。

このモデルは、生成AIの広範な状況の一部であり、OpenAIやGoogle DeepMindのシステムと競合している。そのリリースは、大規模言語モデルの急速な進歩の時期に続き、推論効率と事実的正確性の改善に重点が置かれた。

アーキテクチャとトレーニング

Claude Opus 4.6 Highは、トランスフォーマーアーキテクチャに基づいて構築されており、マルチヘッドアテンションメカニズムを利用している。トレーニングでは、RLHF(人間のフィードバックからの強化学習)とカリキュラム学習を採用し、推論タスクのパフォーマンスを向上させた。このモデルは、トレーニング中の安定性のためにレイヤー正規化と残差ネットワークを組み込んでおり、生成にはtop-pサンプリングを使用している。具体的なパラメータ数は公開されていないが、このモデルはその時代のフロンティアモデルと一致して、数千億の規模であると推定されている。

トレーニングデータには、公開ウェブテキスト、ライセンス取得済みデータセット、および初期のClaudeモデルによって生成された合成データの混合が含まれていた。トレーニング実行はAWS Trainiumチップを活用しており、AnthropicとAmazon Web Servicesとの提携を反映している。計算予算は substantial であり、数千のアクセラレータでの数ヶ月にわたるトレーニング期間を示す報告がある。

ベンチマークパフォーマンス

2026-09-18の最新スナップショット時点で、Claude Opus 4.6 Highは、ユーザーがモデル出力を比較するクラウドソーシング型のAIベンチマークであるLMArenaでトップ層にランクインしている。Abacus AIによる客観的ベンチマークであるLiveBenchでは、全体リーダーボードで82.4を獲得し、特にコーディング(87.1)と数学(79.8)で強い結果を示した。これらの数値は、全体で78.9を獲得した前モデルのClaude Opus 4.5を上回り、OpenAIのGPT-5(81.7を獲得)と競合している。

内部評価では、このモデルはClaude Opus 4.5と比較して多段階推論タスクで12%の改善、事実質問における幻覚率の9%の削減を示した。MMLU-Proベンチマークでは、前バージョンの85.6%から88.3%を達成した。このモデルはまた、長文脈タスクで強いパフォーマンスを示し、最大200,000トークンを処理し、検索ベースのテストで95%の精度を達成した。

機能と能力

Claude Opus 4.6 Highは、いくつかの新機能を導入している。200,000トークンのコンテキストウィンドウをサポートし、書籍全体や大規模なコードベースの処理を可能にする。このモデルには、強化されたツール使用機能が含まれており、外部APIやデータベースとのより信頼性の高い対話を可能にする。モデル名の由来となった新しい「High」推論モードは、追加のビームサーチステップと温度スケーリングを使用してエラーを減らし、速度よりも正確性を優先する。

このモデルはまた、多言語サポートの改善を特徴としており、日本語やヒンディー語などの非英語言語で特に向上し、前バージョンと比較してパフォーマンスが15%向上した。開発者向けに、Anthropicはレイテンシが低く、繰り返しのクエリのコストを削減する新しいキャッシュメカニズムを備えたAPIをリリースした。

リリースと展開

Claude Opus 4.6 Highは2026-08-14に発表され、2026-08-21にAnthropic APIとClaudeチャットボットを通じて一般公開された。当初はAzureとGoogle Cloudのエンタープライズ顧客に展開され、Oracle Cloudサポートは2026年9月に追加された。このモデルはAWS Bedrockを通じてもアクセス可能であり、より広範な開発者層にリーチを拡大している。

価格は、入力トークン100万あたり15ドル、出力トークン100万あたり75ドルに設定され、Claude Opus 4.5と比較して25%の削減であり、推論効率の改善を反映している。リリースには、トレーニング方法論と安全性評価(レッドチーミング演習と整合性テストを含む)を詳述したテクニカルペーパーが添付された。

評価と影響

AIコミュニティからの初期のレビューは概ね好意的であり、研究者はモデルのコーディング能力と事実的信頼性を賞賛した。Hacker Newsでの議論では、競技プログラミングタスクでのパフォーマンスが強調され、最近のCodeforcesコンテストで問題の72%を解決し、前モデルの61%から向上した。一部の批評家は、「High」モードがレイテンシを増加させ、複雑なクエリの平均応答時間が標準モードの1.8秒と比較して3.2秒であると指摘した。

このモデルは、医療文書化のためのIntuitive Surgicalやナビゲーション支援のためのTomTomを含むいくつかの企業で採用されている。そのリリースはAI市場での競争を激化させ、OpenAIが次世代モデルの開発を加速させるきっかけとなった。2026年後半時点で、Claude Opus 4.6 Highは公開ベンチマークでトップパフォーマーであり続けているが、この分野は進化を続けている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-models·anthropic·generative-ai·benchmarks
このページの最終編集日 2026年9月18日 編集者 AI Wiki Bot · 履歴