Sakana Fuguは、東京を拠点とするスタートアップ企業Sakana AIによって開発された生成的人工知能モデルである。2024年に公開され、テキストと画像の効率的な生成を目的として設計されており、Mixture of expertsアーキテクチャを活用して、推論ステップごとにパラメータの一部のみを活性化する。このモデルは、進化的計算と群知能の概念を基にした、自然界に着想を得たアルゴリズムに関するSakana AIの広範な研究の一部である。その名前「Fugu」は、日本のフグを指し、繊細さと、このモデルのコンパクトで効率的な設計の両方を象徴している。
Sakana Fuguは、2024年初頭に技術ブログ記事で初めて発表され、同年後半に一般公開された。このモデルは寛容なオープンソースライセンスの下で提供されており、学術利用と商用利用の両方が可能である。日本語と英語のコンテンツに焦点を当てた、公開されているテキストと画像の厳選されたデータセットでトレーニングされており、Sakana AIの二言語研究目標を反映している。
アーキテクチャと設計
このモデルは、Transformer (architecture)ベースのニューラルネットワークとスパースなMixture of experts層を採用しており、各トークンまたは画像パッチを少数のエキスパートモジュールにルーティングする。この設計により、同様のパラメータ数の高密度モデルと比較して、推論時の計算コストが削減される。Sakana Fuguは、テキストと画像の両方のモダリティにMulti-Head Attentionメカニズムを使用し、入力タイプごとに個別のエンコーダを備えている。画像生成コンポーネントは、U-Netスタイルのデコーダに基づいており、トランスフォーマーフレームワークに適合され、トレーニング全体を通じて安定化のために残差接続を使用している。
トレーニングにはAdam (Optimizer)と、ウォームアップとコサイン減衰を含むLearning Rate Schedulingが採用された。このモデルは、Deep learning研究におけるNVIDIAハードウェアの優位性を考慮すると注目に値する選択である、AMD GPUのクラスターでトレーニングされた。Sakana AIは、この決定の理由として、コスト効率とサプライチェーンの考慮事項を挙げている。
機能とパフォーマンス
Sakana Fuguは、一貫性のあるテキストパッセージの生成、質問への回答、テキスト記述からの画像生成が可能である。Sakana AIが公開したベンチマークでは、このモデルは、LLM評価スイートの日本語版などの日本語理解タスクと、FID(Fréchet Inception Distance)などの画像生成品質指標において、競争力のあるスコアを達成した。このモデルは、テキスト用に8,192トークンのコンテキストウィンドウをサポートし、最大1024x1024ピクセルの解像度で画像を生成する。また、制御された生成のためのTop-P (Nucleus) SamplingとTemperature Scalingもサポートしている。
特徴的な機能の1つは、単一のフォワードパスでマルチモーダル生成を実行できることであり、個別のファインチューニングなしで、画像キャプションやテキストから画像への合成などのタスクが可能になる。このモデルの効率性により、エッジデバイスへの展開に適しているが、公式ドキュメントでは、フルパフォーマンスには少なくとも8 GBのメモリを備えたGPUが必要であると記載されている。
リリースと採用
初期リリースには、ベースモデルと命令チューニング済みバリアントの両方の事前トレーニング済みウェイトが含まれていた。命令チューニング済みバージョンは、RLHF(人間のフィードバックからの強化学習)と追加のCurriculum Learning段階を使用して調整された。リリースから数か月以内に、Sakana Fuguは、特に日本の開発者の間で、オープンソースコミュニティで注目を集めた。これは、いくつかのローカルなAIツールキットに統合され、効率的な機械学習に関する学術論文で参照モデルとして引用されている。
2024年後半の時点で、Sakana Fuguは、AIモデルを評価するためのクラウドソーシングデータセットであるwikipromptプラットフォームで71のプロンプトで使用されており、コンパクトな生成モデルのベンチマークとしての認知度を示している。このモデルのコードとドキュメントはGitHubでホストされており、コミュニティからの活発な貢献がある。
比較と背景
Sakana Fuguは、OpenAIの小型GPTバリアントやAnthropicのClaude Instantなどの他のオープンソースモデルと競合するが、マルチモーダル効率と日本語サポートへの明確な焦点において異なる。多くの場合クラウドベースであるGoogle DeepMindのモデルとは異なり、Sakana Fuguはローカル展開用に設計されている。そのmixture-of-expertsアプローチは、Google DeepMindとNokia Bell Labsの初期の研究に基づいているが、Sakana AIはそれをより少ないパラメータ数に適応させ、個々の研究者がアクセスできるようにしている。
Sakana AIの開発チームには、Stanford AI LabとBAIR (Berkeley AI Research)に以前所属していた研究者が含まれており、同社はAmazon Web Servicesのスタートアッププログラムから資金提供を受けている。このモデルのリリースは、AI21 LabsやInflection AIによる取り組みに見られるように、効率的でオープンソースのAIへの広範なトレンドと一致している。
制限と今後の取り組み
Sakana Fuguの主な制限には、特に日本語と英語以外の言語において、より大規模なモデルと比較して知識ベースが小さいこと、複雑なシーンに対して詳細度の低い画像を生成する傾向があることが含まれる。開発者は、ドキュメントでこれらの問題を認めており、2025年に予定されているより大規模な後継モデルの計画を概説している。今後の取り組みには、テキストと画像のモダリティ間のCross-Attentionメカニズムの改善と、追加言語のサポート拡大も含まれる。
これらの制約にもかかわらず、Sakana Fuguは、効率的なGenerative AI設計の注目すべき例であり、アクセシビリティとリソース保全を優先するモデルの成長するエコシステムに貢献している。