Dolly是一个由Databricks开发的指令微调大型语言模型,于2023年3月首次发布。它证明了,一个相对较小的模型在适度数据集上进行微调,就能实现胜任的指令遵循行为,从而挑战了此前普遍认为大规模和大量专有数据是此类能力必要条件的假设。该项目旨在通过展示微调可以在单台机器上短时间内完成,使企业能够轻松获得LLM定制能力。
初始版本Dolly 1.0基于EleutherAI的GPT-J 6B模型,并在由Databricks员工生成的大约15,000个指令-响应对数据集上进行了微调。随后,Dolly 2.0于2023年4月发布,它使用了相同的基座模型,但引入了一个更大的开源数据集,包含15,000个指令-响应对,并以宽松许可证发布。Dolly 2.0因其成为首批具有完全开放训练数据集的开源指令微调模型之一而闻名,使研究人员能够复现并在此基础上进一步研究。
技术方法
Dolly的训练采用了一种称为指令微调的技术,即在指令和相应响应的示例上对预训练语言模型进行微调。这一过程使模型的行为与用户意图对齐,使其能够遵循各种任务的提示,如摘要、问答和文本生成。微调使用了标准的监督学习目标,优化模型以根据指令预测响应令牌。Databricks利用其自身的机器学习平台来管理训练流程,但模型本身被设计为可在商用硬件上运行,包括用于推理的单个Nvidia A10 GPU。
基座模型GPT-J是一种基于Transformer的架构,具有60亿参数,在Pile数据集上训练。Dolly的微调并未改变基座架构,而是调整权重以专注于指令遵循。这种方法与OpenAI或Anthropic等更大规模的模型形成对比,后者通常需要巨大的计算资源和专有训练数据。
发布与影响
Dolly以Apache 2.0许可证发布,使其可免费用于商业和研究用途。随附的数据集被称为“databricks-dolly-15k”,也进行了开源,这在当时是罕见的。这种开放性使机器学习社区能够研究指令微调的效果,并创建衍生模型。Dolly的发布引发了关于AI民主化的讨论,因为它表明没有庞大资源的组织也能构建出能干的助手。
然而,Dolly的性能并未达到GPT-3.5或Claude等最先进模型的水准,并且在复杂推理和事实准确性方面存在局限。尽管如此,它作为高效微调的概念验证,影响了后来的开源工作,如Alpaca和Vicuna。Databricks将Dolly定位为企业使用自身数据创建定制AI助手的工具,并将其与他们的湖仓架构集成。
反响与遗产
Dolly在发布时获得了大量媒体关注,科技媒体的报道强调了其低廉的训练成本(据报道计算成本低于30美元)以及它对只有科技巨头才能开发LLM这一叙事的挑战。该模型因其透明度而受到赞誉,但一些批评者指出,其能力与商业产品相比有限。随着时间的推移,Dolly被更强大的开源模型所取代,但其数据集和方法论继续用于研究。
Databricks后来将Dolly集成到其平台中,允许客户针对特定用例微调和部署该模型。该项目也为开源LLM开发的更广泛趋势做出了贡献,鼓励了在较小模型上进行指令微调的进一步实验。截至2025年,Dolly被视为可访问AI演变中的一个历史里程碑,尽管它已不再积极开发。
参见
参考文献
(注:本文基于公开可用信息,未引用外部来源。)