Dollyは、Databricksによって開発された大規模言語モデルの指示調整版であり、2023年3月に初めてリリースされた。このモデルは、比較的小規模なモデルを控えめなデータセットで微調整することで、十分な指示追従能力を達成できることを実証し、大規模なスケールと広範な独自データがこうした能力に必須であるという一般的な前提に挑戦した。このプロジェクトは、単一のマシンで短時間に微調整が可能であることを示すことで、LLMのカスタマイズを企業にとって利用しやすくすることを目指した。
初期バージョンであるDolly 1.0は、EleutherAIのGPT-J 6Bモデルに基づいており、Databricksの従業員によって生成された約15,000組の指示と応答のペアからなるデータセットで微調整された。これに続いて2023年4月にDolly 2.0がリリースされ、同じベースモデルを使用しつつ、寛容なライセンスの下で公開された15,000組のより大規模なオープンソースデータセットを導入した。Dolly 2.0は、完全にオープンなトレーニングデータセットを持つ最初のオープンソースの指示調整モデルの1つとして注目され、研究者がその作業を再現し、基盤として発展させることが可能となった。
技術的アプローチ
Dollyのトレーニングでは、指示調整として知られる技術が採用されており、事前学習済みの言語モデルが指示と対応する応答の例で微調整される。このプロセスは、モデルの動作をユーザーの意図に合わせ、要約、質問応答、テキスト生成などのさまざまなタスクでプロンプトに従えるようにする。微調整では標準的な教師あり学習の目的関数を使用し、指示が与えられた際に応答トークンを予測するようにモデルを最適化した。Databricksは独自の機械学習プラットフォームを利用してトレーニングパイプラインを管理したが、モデル自体は単一のNvidia A10 GPUでの推論を含む一般的なハードウェアで実行できるように設計された。
ベースモデルであるGPT-Jは、60億のパラメータを持つトランスフォーマーベースのアーキテクチャであり、Pileデータセットでトレーニングされた。Dollyの微調整はベースアーキテクチャを変更せず、指示追従に特化するように重みを調整した。このアプローチは、OpenAIやAnthropicの大規模モデルとは対照的であり、それらはしばしば膨大な計算リソースと独自のトレーニングデータを必要とする。
リリースと影響
DollyはApache 2.0ライセンスの下でリリースされ、商用および研究目的で自由に利用可能となった。付随するデータセットは「databricks-dolly-15k」と名付けられ、当時としては珍しくオープンソース化された。この開放性により、機械学習コミュニティは指示調整の効果を研究し、派生モデルを作成することができた。Dollyのリリースは、AIの民主化に関する議論を引き起こし、膨大なリソースを持たない組織でも有能なアシスタントを構築できることを示した。
しかし、Dollyの性能はGPT-3.5やClaudeなどの最先端モデルには及ばず、複雑な推論や事実の正確性に限界が見られた。それでも、効率的な微調整の概念実証として機能し、後のAlpacaやVicunaなどのオープンソースの取り組みに影響を与えた。DatabricksはDollyを、企業が自社データを使用してカスタムAIアシスタントを作成するためのツールとして位置づけ、レイクハウスアーキテクチャと統合した。
評価と遺産
Dollyはリリース時に大きなメディアの注目を集め、技術報道では低いトレーニングコスト(計算コストは30ドル未満と報告)と、LLMを開発できるのは大手テクノロジー企業だけという物語への挑戦が強調された。このモデルは透明性が評価されたが、一部の批評家はその能力が商用製品と比較して限定的であると指摘した。時間の経過とともに、Dollyはより強力なオープンモデルに取って代わられたが、そのデータセットと方法論は研究で引き続き使用された。
Databricksは後にDollyを自社プラットフォームに統合し、顧客が特定のユースケース向けにモデルを微調整してデプロイできるようにした。このプロジェクトはまた、オープンソースのLLM開発の広範なトレンドに貢献し、小規模モデルでの指示調整のさらなる実験を促進した。2025年時点で、Dollyはアクセス可能なAIの進化における歴史的なマイルストーンと見なされているが、もはや積極的には開発されていない。
関連項目
- 生成AI
- 深層学習
- ニューラルネットワーク
- Amazon Web Services(クラウドベースのLLMデプロイメント用)
参考文献
(注:この記事は公開情報に基づいており、外部ソースを引用していない。)