AI21 Jamba の発表

英語からの翻訳

2024年2月、AI21 LabsはJambaをリリースしました。これは、Mamba SSMとTransformerアーキテクチャを組み合わせ、256Kトークンのコンテキストウィンドウを持ち、効率性のために専門家の混合を使用するオープンウェイトの大規模言語モデルです。

Jambaは、2024年2月にAI21 Labsが公開した大規模言語モデルである。Mamba状態空間モデル(SSM)と従来のTransformerを組み合わせたハイブリッドアーキテクチャと、最大256,000トークンという長いコンテキストウィンドウを備えている点で注目される。このモデルはオープンウェイトで公開され、研究者や開発者がダウンロードして利用できるようになっており、性能と計算効率のバランスを取るために混合専門家(MoE)設計を採用している。

この公開は、現代のほとんどの大規模言語モデルを支える標準的なTransformerアーキテクチャに代わる選択肢を探る上で、Jambaが重要な一歩であると位置づけられた。線形時間で長いシーケンスを処理できるMamba SSMと、Transformerのアテンション機構の確立された強みを統合することで、AI21 Labsは非常に長いコンテキストを扱う際の計算上の課題に対処することを目指した。

背景と開発

AI21 Labsは、2017年11月にテルアビブ(イスラエル)でYoav Shoham、Ori Goshen、Amnon Shashuaによって設立され、それ以前にJurassicシリーズの言語モデルを開発していた。同社の初期の取り組み(2021年8月に公開されたJurassic-1と2023年3月のJurassic-2など)により、自然言語処理の専門性を確立した。Jambaは、これらの純粋なTransformerベースのモデルに代わるものであり、2023年末にAlbert GuやTri Daoなどの研究者によって導入されたMambaアーキテクチャを組み込んでいた。

Jambaの開発は、アテンションメカニズムの代替または補完としての空間状態モデを探求する広範な研究トレンドの一部であった。選択的な状態空を持つことで知られるMambaアーキテクチャは、標準アテンションの二次スケーリングとは異なり、シーケン長に線形にスケーリングする計算複雑度でシーケンスを処理する方法を提供した。AI21 Labsは、この効率性を複雑な推論や根深い理解を必要とするタスクにおけるTransformerの実証済み能力とを組み合わせようとした。

アーキテクチャと技術詳細

Jambaのアーキテクチャは、Mamba SSM層とTransformer層のハイブリッドで、インターリープされたパターンで配置されている。モデルはフィードフォワード層内で混合エオ(MoE)アプローチを採用しており、各トークンに対してパラメータのサブセットのみを活性化することで、モデル容量を犠牲にせずに推論効率を向上させている。総パラメータ数はかなり多いが、MoE設計により各トークンあたりのアクティブなパラメータ数は大幅に少ない。

256,000トークンのコンテキストウィンドウは主要な売りであり、モデルが全書籍や大規模なコードベンなどの非常に長いドキュメントを1パスで処理できるようにした。この能力は、Mamba層が長距離依存関係を効率的に処理することで実現された。モデルは複数のサイズで公開され、最大バージョンは総パラメータ5億(では12億が任意のトークンあたりの有効パラメータ)になります。

公開と利用可能性

AI21 Labsは2024年2月28日にJambaを発表し、モデルのウェイトをオープンライセンスで公開した。これにより、研究コミュニティはモデルをファインチューニングして自らのインフラストラクチャに導入できた。公開にモデルチェックポイントとドキュメントが含まれ、モデルはHugging Faceなどのプラットフォームで利用可能になった。オープンウェイトアプローチは、OpenAIやAnthropicの競合他社が提供するクローズ型モデルとは対照的で、AI21 LabsはAI21 Studioプラットフォームを通じて商用アクセスも提供していた。

公開のタイミングは、OpenAIのGPT-4、AnthropicのClaude、Google DeepMindのGeminiなどのモデルと並ぶ競争環境にJambaを配置した。Jambaはこれらの先端モデルレベルの総合的なベンチマーク性能には匹敵しなかったが、その独自のアーキスチャと長いコンテキストウィンドウは、特に長時間のドキュメント処理を必要とするアプリケーションにとって、この分野への注目すべき貢献でした。

性能とベンチマーク

AI21 Labsが報告したベンチーナークでは、長いコンテキストの理解を要するタスク(長いドキュメントの要約や質問応答など)でJambaは強固な性能を示した。モデルはMixtral 8x7Bなど同様のサイズの他のオープンウェイトモデルと競争的にパフォーマンスを発揮し、同時に長いコンテキストウィンドウを提供した。MMLUやHellaSwagなどの標準的な自然言語処理ベンチマークでは、Jambaのパフォーマンスは堅実でしたが最先端ではありませんでした。これはのハイブリッド設計のトレードオフを反映しています。

性の側面でのMamba層の効率性の利得は、スループットテストで強調されました。Jambaは同規模の純Transformerモデルと比較して高いトーケン生成速度を示しました。これにより、モバイル端末などの制約ある環境やリアルタイム応答が必要なアプリケーションでの展開が魅力になりました。

受容と影響

Jambaのリリースは、特にTransformerアーキテクチャの代案を探す研究者の間で、機械学習コミュニティの関心を集めました。モデルのオープンウェイトは、ハイブリッドSSM-Transformerデザインのさらに研究を促進し、いくつかの後続研究でJambaがインスピレーションとして埆引されました。モデルはまた、状態空間モデルが実用的なサイズまでスケールできることを示し、この研究ラインへの投資を奨励しました。

批判者は、Jambaのパフォーマンス性能がいくつかのベンチナークで先行のクローズドモデルに及ばず、アーキテクチャの複雑さがファインチューニングと展開に課題をもたらす可能性がないと事例しました。しかし、長いコンテキストウィンドウと効率性は本物の利点と見られ、AI21 Labsはその後のリリースで設計の反復を続けました。

その後の展開

初期のJambaリリースに続き、AI21 Labsはモデルファミリの開発を続けました。2024年9月、同中組みはAmazonWeb と提携し、Jamba 1.5ファミリをAmazon Bedrockで利用可能にし、エンタープライズアプリに統合しました。2025年3月には、AI21 Labsが企業専用のワンバ 1.6を発ーリリースし、複のベンチマークで改善された性能を主張しました。同社はまた、同じ月にAI計画システムMaestroを開設しました。

これらの後半バージョンはハイブリッドアーキテクチャを洗練し、モデルの能力を拡張しましたが、Mamba SSMとは層を組み合わせたコアな革新は中心的なままでした。トロンとともに、Jambaファミはオープンウェイトモデル分野でAI21 Labsを重要なプレーヤーとして確立し、MetaやMarc AIなどの組織と並びました。

AI研究における意義

Jambaの発表は、深層学習におけるアーキテクチャ革新の使用に関する進行中の探索に貢献しました。ハイブリッドアプローチの成功は、将来の大規模言語モデルがアテンション機構のみに依存するのではなく、他のシーケンス処理技術を含む可能性を示唆しました。大手モデルのトレーニングと展開の計算コストへの懸念が増える中、以下の重要性も強調しました。

オープンウェイトの公開により、学術機関や独立研究者がモデルの動作を研究することができ、さまざまなアーキテクチャコンポーネントの相互作用の理解に貢献しました。多くの主要モデルがクローズ型である分野でこの透明性が評価され、高度なAI技術へのアクセス民主化に役立ちました。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-models·ai21-labs·machine-learning·artificial-intelligence
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴