英語からの翻訳

Gemmaは、Google DeepMindによって開発された、Gemini技術に基づくソース利用可能な大規模言語モデルのシリーズである。2024年2月からリリースされ、PaliGemmaやMedGemmaなどのバリエーションを含み、最新のオープンウェイト版Gemma 4は2026年4月にリリースされた。

Gemmaは、Google DeepMindによって開発された、ソース利用可能な大規模言語モデルのシリーズである。これはGeminiシリーズのモデルと同様の技術に基づいており、Googleの「AIをすべての人に役立つものにする」というミッションを支援することを目的としている。最初のバージョンは2024年2月にリリースされ、続いて2024年6月にGemma 2、2025年3月にGemma 3、2026年4月にオープンウェイトのGemma 4がリリースされた。また、視覚言語モデルのPaliGemmaや、医療相談トピック向けのモデルMedGemmaなど、Gemmaの変種も開発されている。

歴史

2024年2月、GoogleはGeminiの軽量版として機能する、ソース利用可能なLLMのコレクションであるGemmaを発表した。初期リリースは2つのサイズで提供され、それぞれ20億パラメータと70億パラメータのニューラルネットワークであった。複数の出版物は、これをMetaが自社のAIモデルのソースコードを公開するなどの競合他社への対応であり、Googleが長年続けてきたAIソースコードの非公開方針からの転換であると見なした。

Gemma 2は2024年6月27日にリリースされ、Gemma 3は2025年3月12日にリリースされた。2026年4月2日、GoogleはGemma 4を無料かつオープンソースのApache 2.0ライセンスの下でリリースした。

概要

Geminiシリーズのモデルと同様の技術に基づくGemmaは、Googleによって「AIをすべての人に役立つものにする」というミッションを支援するものと説明されている。Googleは、医療分析用のMedGemmaなど、特定のユースケースに最適化された公式のGemma変種を提供している。

リリース以来、Gemmaモデルは1億5000万回以上のダウンロードを記録し、Hugging Face上で7万の変種が利用可能である。

Gemma 3は、10億、40億、120億、270億パラメータのサイズで提供され、140以上の言語をサポートしている。マルチモーダルモデルとして、テキストと画像の両方の入力をサポートする。Googleはまた、スマートフォン、ラップトップ、タブレットなどの消費者向けデバイスでの実行に最適化された小型モデルであるGemma 3nも提供している。

最新世代のモデルは、2026年4月2日にリリースされたGemma 4である。これは4つのサイズで提供される: Effective 2B (E2B)、Effective 4B (E4B)、26B Mixture of Experts (MoE)、および31B Dense。Gemma 4は、すべてのモデルで画像と動画を含むマルチモーダル入力をサポートし、E2BおよびE4Bモデルではネイティブの音声入力をサポートする。Gemma 4の31B Dense変種はArenaのテキストリーダーボードで3位に達し、26B変種は6位に達した。Gemma 4 12Bは2026年6月3日にリリースされ、エンコーダなしで画像と音声を処理する統合マルチモーダルアーキテクチャを特徴とする。

アーキテクチャ

Gemma 3は、デコーダーのみのトランスフォーマーアーキテクチャと、グループ化クエリアテンション (GQA) およびSigLIPビジョンエンコーダに基づいている。すべてのモデルは128Kのコンテキスト長を持ち、例外としてGemma 3 1Bは32Kのコンテキスト長を持つ。

量子化対応トレーニング (QAT) を使用して微調整された量子化バージョンも利用可能であり、精度と正確性にいくらかの悪影響を及ぼすものの、メモリ使用量の大幅な改善を提供する。

変種

Googleは、医療分析やプログラミングなど、特定の目的のために設計されたGemmaモデルの公式変種を開発している。これらには以下が含まれる:

  • CodeGemma (2Bおよび7B): CodeGemmaは、コード補完および一般的なコーディング用途のために設計されたモデルのグループである。Python、Java、C++などを含む複数のプログラミング言語をサポートする。
  • DolphinGemma (約400M): ジョージア工科大学およびWild Dolphin Projectの研究者との協力により開発されたDolphinGemmaは、音声分析を通じてイルカのコミュニケーションをよりよく理解することを目的としている。ただし、モデルやデータは公開されていない。
  • MedGemma (4Bおよび27B): 同じくGemma 3に基づくMedGemmaは、画像分析などの医療用途向けに設計されている。ただし、GoogleはMedGemmaが「まだ臨床グレードではない」とも指摘している。インドのグルグラムにあるTap Healthの開発者は、AI支援の糖尿病管理アプリケーションを強化するためにMedGemmaを使用している。
  • PaliGemma (3B、10Bおよび28B、それぞれ2B、9Bおよび27BのGemma 2に基づく): 機械視覚および画像分析用。
  • ShieldGemma 2 (4B): Gemma 3ファミリーに基づくShieldGemmaは、暴力的、危険、および性的に露骨な画像を識別してフィルタリングするように設計されている。
  • TranslateGemma (4B、12Bおよび27B): 機械翻訳用。

注: オープンウェイトモデルは、推論時にコンテキスト長を再スケーリングできる。Gemma 1、Gemma 2、PaliGemma、およびPaliGemma 2では、コストはコンテキストウィンドウサイズに比例したkvキャッシュサイズの線形増加である。Gemma 3では、ローカルとグローバルのアテンションの分離により、改善された成長曲線がある。RecurrentGemmaでは、2,048トークン以降のメモリ使用量は変わらない。

関連項目

  • 大規模言語モデルの一覧
  • オープンソース人工知能ソフトウェアの一覧

参考文献

外部リンク

  • 公式ウェブサイト
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-models·google-deepmind·open-source-ai·generative-ai
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴