WizardLMは、大規模言語モデルのファミリーであり、機械学習のファインチューニングに用いられる複雑な命令データを自動生成する手法であるEvolve-Instruct法を導入したプロジェクトである。最初のWizardLMモデルは2023年に公開され、Transformer (architecture)アーキテクチャに基づくLLaMAを基盤としており、マルチヘッドアテンションとレイヤー正規化に依存している。
「WizardLM」という名称は、複雑なユーザー命令を処理する能力をモデルに持たせるという目標を反映しており、まるで魔法使いの専門知識のようなものを指す。これらのモデルは生成AIの広範な分野の一部であり、人工知能研究の進歩に基づいている。WizardLMは、モデルがユーザーの要求を高精度で解釈し実行する必要がある命令追従の課題に対処するために設計された。
背景と動機
命令チューニングは、ニューラルネットワークをユーザーのプロンプトに従うように適応させる標準的な手法である。このプロセスでは、ベースモデルが命令と期待される応答のペアでファインチューニングされる。しかし、多様で複雑な命令を手動で作成することは労力がかかり、深みに欠けるデータセットになることが多い。WizardLMは、AIシステムを使用して単純なシード命令をより複雑な形式に進化させることで、この問題に対処する。このアプローチは、モデルが徐々に難しい例で訓練されるカリキュラム学習に関連している。目標は、モデルをより広範な推論パターンと制約にさらし、それによって実世界のユーザー要求を処理する能力を向上させることである。
Evolve-Instruct法は、2023年4月にarXivに投稿された「WizardLM: Empowering Large Language Models to Follow Complex Instructions」という論文で紹介された。著者はMicrosoft Research Asiaに所属していた。この論文では、深い進化と深層進化という2段階のプロセスが提案された。深い進化では、モデルが制約を追加、推論を深化、または入力を複雑化することで新しい命令を生成する。深層進化では、モデルが既存の命令を書き換えて複雑性を高める。結果として得られたデータセットは、ベースモデルのファインチューニングに使用される。
Evolve-Instruct法
Evolve-Instruct法は、ChatGPTなどの教師モデルを使用して、制約の追加、推論の深化、入力の複雑化などの操作を通じてシード命令を書き換える。進化した命令は、ファインチューニングのためのデータ拡張の一形態として機能する。この手法には、制約の追加、深化、具体化、推論ステップの増加など、複数の進化タイプが含まれる。例えば、「詩を書いて」という単純な命令は、「愛することを学ぶロボットについてシェイクスピア風の詩を書いて」というように進化する可能性がある。これにより、タスクの複雑性と特異性が高まる。
このプロセスは反復的であり、モデルはより困難な命令に繰り返しさらされる。著者らはまた、曖昧すぎる命令や回答不可能な命令をフィルタリングする品質管理メカニズムを導入した。これにより、トレーニングデータが有用なまま維持され、モデルのパフォーマンスを低下させないことが保証される。進化した命令は、元のシード命令と組み合わせて最終的なトレーニングセットが作成される。
モデルバージョンとベンチマーク
最初のWizardLMモデルであるWizardLM-7Bは、LLaMA-7Bからファインチューニングされた。後のバージョンにはWizardLM-13BとWizardLM-30Bが含まれる。これらのモデルは、Evol-Instructテストセットや他のベンチマークで評価された。著者らは、WizardLM-7Bが複雑な命令追従においてChatGPTを上回ったと報告している。具体的には、GPT-4を判定者として使用して応答を比較し、WizardLM-7BがEvol-Instructテストセットでより高い勝率を達成したことを見出した。その後のバージョンであるWizardLM v1.1やv1.2では、より大規模なトレーニングデータセットや改善された進化戦略など、さらなる改良が組み込まれた。
モデルの重みは公開されており、研究者や開発者が使用およびファインチューニングできるようになっている。WizardLMモデルはまた、さまざまなオープンソースプロジェクトに統合され、後の命令追従モデルのベースラインとして機能した。2024年時点で、WizardLMファミリーには異なるサイズのモデルが含まれており、Evolve-Instruct法は他のドメインにも適用されている。
影響と関連研究
WizardLMのEvolve-Instruct法は、コード生成用のWizardCoderや数学的推論用のWizardMathなど、後のモデルに影響を与えた。これらのモデルは、専門分野に同様の進化技術を適用し、このアプローチの汎用性を示した。この手法は分野の他の研究者にも採用され、論文は広く引用されている。WizardLMは、自動データ生成による命令追従の改善を目指す深層学習の広範なトレンドの一部である。この手法はまた、命令追従モデルのためのより洗練された評価ベンチマークの開発にも貢献した。