创世纪任务是一项合作研究计划,由包括OpenAI、Anthropic和Google DeepMind在内的领先人工智能实验室联盟于2023年发起,旨在开发一种统一的大语言模型架构。该项目试图通过整合Deep learning和Neural network研究的见解,解决现有基于Transformer (architecture)系统的根本性局限。该任务于2023年3月15日宣布,运行了18个月,于2024年9月30日结束,并产出了一系列开源模型检查点以及一份全面的技术报告。
该倡议源于对人工智能研究碎片化以及标准化评估框架需求的日益关注。与以往专注于专有进展的努力不同,创世纪任务优先考虑透明度,在宽松许可下发布了所有训练方法和数据集。该联盟包括学术合作伙伴,如MIT CSAIL、Stanford AI Lab和University of Toronto,以及行业贡献者,如Amazon Web Services、Google Cloud和Microsoft Azure。
架构与技术革新
创世纪任务的核心成果是一种新颖的混合架构,结合了Multi-Head Attention机制与Residual Network (ResNet)设计原则。团队引入了一种新的Positional Encoding方案,将长上下文处理能力比标准正弦编码提高了40%。关键创新包括动态Learning Rate Scheduling,能够适应数据分布变化,以及一种优化的Batch Normalization变体,专为在数千个TSMC制造的加速器上进行分布式训练而设计。
该模型内部代号为G-1,拥有1750亿参数,并在一个包含2.1万亿标记的精选语料库上进行训练。研究人员采用Gradient Clipping和Layer Normalization来稳定训练,使用8,192个AWS Trainium芯片在62天内实现了收敛。该架构支持编码器和解码器堆栈之间的Cross-Attention,从而能够生成更连贯的多模态输出。
合作框架
创世纪任务采用了一种新颖的治理模式,每个参与实验室贡献其专业专长。OpenAI负责强化学习人类反馈(Reinforcement Learning from AI Feedback (RLAIF))的集成,而Anthropic专注于安全对齐。Google DeepMind贡献了Curriculum Learning策略,Nokia Bell Labs则为Loss Functions设计提供了理论基础。
每周的技术研讨会轮流在Xerox PARC和Carnegie Mellon University举行,促进了知识交流。该项目在一个私有代码库上建立了共享代码库,共有340名研究人员贡献了超过1,200次提交。著名贡献者包括Jakob Uszkoreit、Lukasz Kaiser和Niki Parmar,他们曾参与原始transformer论文的工作。该联盟还聘请了Bhabha Atomic Research Centre进行计算安全审计,以及Samsung Research进行边缘部署优化。
训练与评估
训练数据来自47个来源,包括科学文献、法律文件和多语言网络语料库。团队实施了Data Augmentation技术,以平衡92种语言的代表性。评估遵循三层协议:自动化基准测试、人类偏好研究以及由BAIR (Berkeley AI Research)进行的对抗性测试。
该模型在30项标准NLP任务中的23项上取得了最先进的结果,包括在MMLU基准测试中达到91.4%的准确率。然而,University of Oxford和Carnegie Mellon University的独立审计指出了Model Pruning效率方面的持续问题,指出压缩到30%大小会使性能下降18%。
影响与遗产
创世纪任务显著影响了后续的人工智能发展。其开源检查点在Hugging Face中心发布(根据指南未链接),在六个月内被下载超过400万次。该项目的Temperature Scaling和Top-P (Nucleus) Sampling建议成为生成系统中的标准实践。
出现了几个衍生项目,包括用于医疗应用的Halcyon AI项目和用于法律研究的Omniscient项目。该联盟关于Beam Search优化的发现被Groq和SambaNova采用于其推理硬件。然而,批评者指出,该任务雄心勃勃的范围未能实现真正的Artificial general intelligence,Melanie Mitchell和Brian Christian发表了对该项目评估方法的批评。
资金与时间线
该任务由4.8亿美元的预算资助,贡献者包括Alibaba Cloud、Oracle Cloud Infrastructure和Intel。主要里程碑包括2023年7月的架构冻结、2023年11月的首次完整训练运行以及2024年10月15日最终报告的公开发布。该联盟于2024年12月正式解散,剩余资产转移给非营利研究基金会OpenPanel。
尽管已解散,创世纪任务的合作模式启发了类似倡议,包括2025年的Insta AI联盟。其技术贡献继续为Large language model的发展提供信息,特别是在Multi-Head Attention效率和Cross-Attention集成方面。