Zephyrは、Hugging Faceチームによって開発されたオープンウェイトの大規模言語モデルのファミリーであり、役に立ち、整合性のあるアシスタントとして機能するように設計されている。これらのモデルは、Mistral AIが作成したベースモデルを、蒸留直接選好最適化(dDPO)と呼ばれる技術を用いてファインチューニングしたものである。このアプローチは、より大規模で高性能な教師モデルからのフィードバックを活用してファインチューニングプロセスを導き、指示に従い、有用かつ無害な応答を生成するモデルの能力を向上させることを目的としている。
このシリーズの最初のモデルであるZephyr-7B-alphaは2023年10月にリリースされ、続いてZephyr-7B-betaが2023年11月にリリースされた。これらのモデルは、70億パラメータのTransformer (architecture)モデルであるMistral-7Bアーキテクチャに基づいている。Zephyrシリーズは、そのサイズに比して様々なベンチマークで優れた性能を示し、しばしばはるかに大規模なモデルと競合することで知られている。このプロジェクトはオープンアクセスを重視しており、ウェイトとトレーニングコードは公開されており、生成AIの研究開発のより広いエコシステムに貢献している。
開発とトレーニング
Zephyrモデルは多段階のプロセスでトレーニングされた。最初に、ベースのMistral-7Bモデルが、指示と応答のデータセットでファインチューニングされ、教師ありファインチューニング(SFT)を用いてモデルに基本的な会話および指示行動を教えた。これに続いて、人間のフィードバックからの強化学習(RLHF)の変種であるdDPOが適用された。dDPOでは、モデルは直接的な人間のアノテーションではなく、GPT-4などの教師モデルから導出された選好に合わせて最適化される。選好データは、教師モデルがプロンプトに対して複数の応答を生成し、それらをランク付けすることで構築され、広範な人間によるラベリングなしにアライメントを改善するためのスケーラブルな方法を提供した。
トレーニングの重要な側面は、60,000以上のプロンプトと選好ペアを含むUltraFeedbackと呼ばれる厳選されたデータセットの使用であった。トレーニングプロセスには、推論中の創造性と一貫性のバランスを取るためのRLHFやtop-pサンプリングなどの技術も組み込まれた。開発者は、dDPO法が従来のRLHFと比較して計算効率が高く、トレーニング中に別の報酬モデルやオンラインサンプリングを必要としないことを強調した。
モデルバリアントと性能
Zephyr-7B-alphaとZephyr-7B-betaは主要なリリースバリアントであり、どちらも70億パラメータを持つ。ベータ版は、トレーニングデータとハイパーパラメータの改良を組み込んでおり、MT-Bench、AlpacaEval、Open LLM Leaderboardなどのベンチマークで性能が向上した。MT-Benchでは、Zephyr-7B-betaは7.34のスコアを達成し、同サイズの多くのモデルや、Llama-2-70B-chatなどの一部の大規模モデルをも上回った。これらのモデルは、コンシューマーグレードのハードウェアで実行できるように設計されており、研究者や愛好家が利用しやすい。
Zephyrシリーズはまた、コミュニティによるさらなるファインチューニングのベースとしても使用され、専門的なアプリケーションの基盤としての有用性を示している。しかし、これらのモデルは、LLMに共通する限界、すなわち潜在的なバイアスや、もっともらしいが不正確な情報を生成する傾向を保持しており、開発者はこれをモデルカードに文書化している。
技術的アプローチ
Zephyrの技術的基盤はMistral-7Bアーキテクチャにあり、グループ化クエリアテンションとスライディングウィンドウアテンションを採用して、推論速度とメモリ効率を向上させている。ファインチューニングプロセスでは、ウォームアップを伴う学習率スケジュールと、トレーニングを安定させるための勾配クリッピングが使用された。dDPOの目的関数は、参照モデルに対するポリシーの直接最適化であり、選好ペアに対するバイナリクロスエントロピー損失を使用する。この方法は、別の報酬モデルを必要とせずにRLHFパイプラインを簡素化するDPO(直接選好最適化)フレームワークから派生している。
Zephyrの推論では、通常、開発者がバランスの取れた出力を達成するために推奨するように、約0.7の値の温度スケーリングと0.95の値のtop-pサンプリングが使用される。モデルは8,192トークンのコンテキスト長をサポートしており、中程度の長さの会話が可能である。
影響と評価
Zephyrのリリースは、より大規模なモデルと競合できる、より小型で効率的なモデルのトレンドに貢献した。これは、人間の価値観にモデルを整合させるための選好最適化技術の有効性を浮き彫りにし、プロジェクトのオープンソースの性質は広範な採用と実験を促進した。このモデルは学術研究で引用され、チャットボットから教育ツールまで様々なアプリケーションで使用されている。その成功は、機械学習コミュニティ内でのdDPOおよび類似のアライメント手法に関するさらなる研究も促進した。
限界と倫理的考慮事項
他のLLMと同様に、Zephyrはバイアスのあるコンテンツや有害なコンテンツを生成する可能性があり、事実を幻覚することがある。開発者は、このモデルは追加の安全策なしにリスクの高い意思決定には適していないと述べている。公開ソースと合成選好から導出されたトレーニングデータは、既存の社会的バイアスを反映している可能性がある。ユーザーは、モデルを展開する際に適切な安全対策を実装することが推奨される。このプロジェクトは、人工知能における能力のあるモデルへのアクセスを民主化するというより広い取り組みと一致しており、責任ある使用の必要性を認識している。
将来の方向性
Zephyrシリーズは他のモデルに引き継がれているが、その方法論は影響力を持ち続けている。効率的なアライメントとオープンウェイトへの焦点は、同様のプロジェクトに影響を与え、これらの技術はより大規模なトレーニングパイプラインに統合されている。Hugging Faceチームは、選好最適化とモデル評価の改善を引き続き探求しており、堅牢性と安全性に重点を置いている。
参考文献とさらなる読み物
詳細な技術情報については、Hugging Face HubのZephyrモデルカードが、トレーニングの詳細、ベンチマーク結果、使用例を含む包括的なドキュメントを提供している。関連する研究論文「Zephyr: Direct Distillation of LM Alignment」は、dDPO法とその実証結果の詳細な分析を提供している。