开放权重模型是机器学习模型,通常是大型语言模型或其他基础模型,其训练参数(即权重)公开发布,任何人都可以下载、本地运行、检查并微调。这与专有或封闭模型(如GPT-4或Claude)形成对比,后者仅可通过付费API或托管界面访问,底层权重保持私有。
术语
开放权重常被用来替代开源,因为仅发布权重并不符合传统的开源定义,后者通常要求训练数据、训练代码和方法论也公开且可自由复用。大多数广泛使用的开放模型,包括Llama、Mistral的发布版本以及Qwen,都公开了权重及部分架构细节,但未公开完整训练数据或完整训练配方,这使得开放权重比开源AI更为精确,后者是开放源代码促进会等组织致力于更严格定义的一个短语。
历史
早期有影响力的开放发布包括Meta的Llama模型,该模型于2023年2月首次发布,最初在官方广泛发布前被泄露,引发了一波社区微调和衍生模型的热潮。Stability AI的Stable Diffusion(2022年)在图像生成领域发挥了类似作用。在2023年至2025年间,开放权重发布激增,包括Mistral AI的模型、阿里巴巴的Qwen系列,以及值得注意的是,2025年1月DeepSeek的DeepSeek-R1,这是一款开放权重推理模型,其训练效率方面的主张促成了DeepSeek市场冲击。非营利和研究机构的工作,包括艾伦人工智能研究所的OLMo项目,则追求更全面的开放性,在发布权重的同时也公开训练数据和代码。
许可
开放权重模型在多种许可下发布,从接近传统开源的宽松许可,到施加条件的定制许可,例如基于公司收入的用量上限,或限制使用输出来训练竞争模型。这种差异使得“开放”成为一个有争议的标签,因为两个都被描述为开放权重的模型可能带有截然不同的法律条款。
开放与封闭之争
开放权重发布的支持者认为,这能民主化对强大AI的访问,促进独立的安全研究和可解释性工作,避免供应商锁定,并允许在隐私敏感或离线环境中部署。批评者,包括AI安全领域的一些声音,则认为一旦权重公开,托管模型中内置的安全缓解措施(例如针对有害使用的护栏)可被任何具备微调技术能力的人移除,并且开放发布消除了事后撤销危险能力访问的任何可能性。杨立昆等人物主张开放对于竞争和科学进步至关重要,而其他人则倾向于更谨慎的分阶段发布实践,正如OpenAI在2019年对GPT-2最初采取的做法。
经济与地缘政治维度
开放权重发布已成为一种竞争策略:Meta将Llama定位为将基础模型层商品化的手段,同时在其产品和基础设施上展开竞争;中国实验室激进的开放发布在一定程度上被视为对美国先进芯片出口管制的回应,因为广泛采用的开放模型即使在领先专有API受限的环境中也能扩展影响力。截至2025年,来自多个实验室的开放权重模型在许多基准测试上接近领先封闭模型的性能,尽管最大的前沿模型总体上仍保持封闭。