英語からの翻訳

Chinchillaは、2022年3月にGoogle DeepMindによって開発された大規模言語モデルのファミリーであり、モデルサイズを2倍にする際にトレーニングトークンも2倍にすることを推奨する、計算最適なトレーニングスケーリング則を確立したことで知られている。

チンチラは、Google DeepMindの研究チームによって開発され、2022年3月に発表された大規模言語モデル(LLM)のファミリーです。このファミリーは、以前のGopherモデルファミリーでの研究を基に、言語モデルのスケーリング則を調査するために設計されました。チンチラモデルはトランスフォーマーベースであり、固定された計算予算の下でより良い性能を達成するように訓練され、大規模モデルを効率的に訓練するための広く引用される推奨事項につながりました。

「チンチラ」という名前は、以前のGopherモデルファミリーに対するさらなる発展としての役割を反映しています。両方のファミリーは、モデルサイズとトレーニングデータ量がどのように相互作用するかを探るために訓練されました。チンチラは、大幅に少ないパラメータを使用しながらGPT-3を上回る性能を主張し、推論と微調整のための計算要件を削減することで、下流タスクでの実用的な展開を簡素化しました。

スケーリング則とトレーニング

チンチラ研究の中心的な発見は、与えられた計算予算に対して、モデルサイズとトレーニングトークンの数がほぼ同じ割合でスケールされるべきであるということでした。具体的には、モデルサイズを2倍にする場合、トレーニングトークンの数も約2倍にする必要があります。この原則は、以前に訓練された言語モデルの分析から導き出されました。この洞察に基づき、DeepMindは70億パラメータのチンチラを訓練し、1.4兆トークンを使用しました。これは、3000億パラメータのGopherが使用したデータ量の約4倍に相当し、全体の計算コストは同等でした。

この計算最適なアプローチは、モデルのパラメータ数を増やすことだけに焦点を当てた以前の慣行とは対照的でした。チンチラチームは、モデルサイズを増やさなくても、より大規模で高品質なトレーニングデータセットを使用することで、下流タスクでより良い結果が得られることを推奨しました。これらの発見は、その後のAI研究におけるトレーニング方法論に影響を与えました。

性能とベンチマーク

チンチラは、Measuring Massive Multitask Language Understanding(MMLU)ベンチマークで平均精度67.5%を達成し、Gopherの性能を7%上回りました。この改善は、Gopherが2800億パラメータを持ち、チンチラの4倍の規模であったことを考えると注目に値します。モデルの効率性により、推論と微調整のための計算要求が低減され、より広範なアプリケーションで実用的になりました。

2023年1月12日の時点で、チンチラはまだテスト段階にあり、その完全な能力と限界が評価されているところでした。MMLUのようなベンチマークでの成功は、計算最適なトレーニングが、より少ないデータで訓練された大規模モデルと比較して、競争力のある、または優れた結果を生み出すことができることを実証しました。

アーキテクチャ

チンチラとGopherの両方のファミリーは、トランスフォーマーモデルです。これらは本質的にGPT-2と同じですが、サイズが異なり、いくつかのマイナーな変更が加えられています。Gopherファミリーは、LayerNormの代わりにRMSNormを使用し、絶対位置エンコーディングの代わりに相対位置エンコーディングを使用します。チンチラファミリーはGopherファミリーと同一ですが、Adamオプティマイザの代わりにAdamWオプティマイザで訓練されています。

Gopherファミリーには、4400万パラメータから2800億パラメータまでの6つのモデルが含まれており、最大のものはデフォルトで「Gopher」と呼ばれます。同様の命名規則がチンチラファミリーにも適用され、さまざまなサイズのモデルが含まれ、70億パラメータバージョンが最も顕著です。元の論文の表1はGopherファミリー全体を詳述し、表4は70億パラメータのチンチラとGopher 280Bを比較しています。

応用と影響

チンチラは、視覚とテキストの理解を統合するFlamingoビジョン言語モデルを含む、他のモデルの基盤として使用されてきました。チンチラによって確立されたスケーリング則は、その後のLLM開発におけるモデルサイズとデータセットサイズに関する決定を導く標準的な参照となっています。

この研究は、限られた計算リソースで大規模な自己回帰言語モデルを訓練するための効果的なパラダイムの開発に貢献しました。データ量がモデルサイズと同じくらい重要であることを実証することで、チンチラはデータセットの品質とキュレーションに焦点を移しました。これは、OpenAIAnthropicなどの組織がモデルトレーニングに取り組む方法に永続的な影響を与えましたが、彼らの内部慣行の具体的な詳細は必ずしも公開されていません。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-models·google-deepmind·scaling-laws·transformer-models
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴