英語からの翻訳

Gopherは、Google DeepMindによって開発されたトランスフォーマーベースの大規模言語モデルのファミリーであり、最大のバリアントは2800億のパラメータを含んでいます。これは、言語モデルのスケーリング則を調査するために設計され、Chinchillaモデルファミリーの前身として機能しました。

Gopherは、Google DeepMindの研究チームによって開発された大規模言語モデルのファミリーである。このファミリーは、4400万パラメータから2800億パラメータまで規模が増大する6つのトランスフォーマーベースのモデルで構成され、最大のモデルはデフォルトで「Gopher」と呼ばれる。Gopherは2021年後半に発表され、大規模言語モデルのスケーリング則を調査するために訓練され、2022年3月に導入された後続のChinchillaモデルファミリーの基盤を形成した。

Gopherファミリーは、モデルの性能がパラメータと訓練データとともにどのようにスケールするかという、より広範な研究努力の一環として設計された。モデルは本質的にGPT-2と同じアーキテクチャであり、LayerNormの代わりにRMSNormを使用し、絶対位置エンコーディングではなく相対位置エンコーディングを使用するなど、小さな変更が加えられている。最大のGopherモデル(2800億パラメータ)は、約3000億トークンで訓練された。

スケーリング則と訓練

Gopherの開発は、大規模言語モデルの訓練時に計算リソースを最適に配分する方法という問いによって動機付けられた。Gopher以前は、OpenAIのGPT-3を含む多くのモデルが、訓練データを比較的固定したままモデルサイズの増加に焦点を当てて訓練されていた。しかし、Gopherの研究チームは、経験的研究を通じて、与えられた計算予算に対して、最適なモデルサイズと訓練トークン数は特定の関係に従うことを発見した。すなわち、モデルサイズを2倍にした場合、訓練トークン数も2倍にするべきである。この発見は、後にChinchilla論文で形式化され、既存の多くのモデルが訓練不足であることを示唆した。

Gopherの訓練には大規模なテキストデータのコーパスが使用され、モデルはさまざまな自然言語処理ベンチマークで強い性能を示した。しかし、Measuring Massive Multitask Language Understanding(MMLU)ベンチマークでの性能は平均精度60.5%であり、この数値は後に後継のChinchillaによって上回られることになる。

アーキテクチャとバリアント

Gopherファミリーには、4400万、1億1700万、4億1700万、14億、71億、2800億のパラメータ数を持つ6つのモデルが含まれる。すべてのモデルは、トランスフォーマーアーキテクチャに基づく同じコアアーキテクチャを共有し、具体的にはGPT-2に類似しているが、前述の変更が加えられている。計算効率が高い層正規化の変種であるRMSNormの使用と、より長いシーケンスへの一般化を改善できる相対位置エンコーディングは、初期のトランスフォーマーモデルとの主な違いであった。

最大のGopherモデルは、分散訓練セットアップを使用して訓練され、数千のアクセラレータを活用した。訓練プロセスはリソース集約的であり、モデルは推論とファインチューニングの両方に多大な計算能力を必要とし、この制限が後のChinchillaの開発を動機付けた。

性能と評価

Gopherは、言語モデリング、読解、質問応答など、さまざまなベンチマークで評価された。多くの分野で強い能力を示したが、その性能はすべてのタスクで小規模モデルよりも一様に優れているわけではなかった。例えば、推論や知識集約的なタスクではGopherは良好な性能を示したが、事実の一貫性や常識推論などの分野では限界も示した。

GPT-3と比較して、Gopherはいくつかのベンチマークで競争力のある、またはより良い結果を達成したが、その差は必ずしも劇的ではなかった。研究チームは、Gopherの性能向上はモデルサイズの大幅な増加に比べてしばしば控えめであり、これが訓練データのスケーリングの重要性をさらに強調したと述べた。

遺産と後継

Gopherの主な遺産は、言語モデルにおけるスケーリング則の理解への貢献である。Gopherの訓練から得られた洞察は、1.4兆トークンで訓練された700億パラメータのモデルファミリーであるChinchillaの設計に直接情報を与えた。2022年3月に発表されたChinchillaは、同様の計算予算を使用しながら、Gopherよりも高い平均精度(MMLUで67.5%)を達成し、スケーリング則の推奨が効果的であることを実証した。

ChinchillaファミリーはGopherと同じアーキテクチャを共有するが、Adamの代わりにAdamWオプティマイザで訓練された。Gopherはまた、Gopherファミリーのコンポーネントを利用したFlamingo視覚言語モデルなど、他のモデルの基盤としても機能した。2023年1月時点で、Chinchillaはまだテスト段階にあり、一方Gopherはより効率的な後継に取って代わられていた。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-models·google-deepmind·transformer-models·artificial-intelligence
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴