OpenAI安全研究是OpenAI内部专注于研究和缓解与先进人工智能系统相关风险的部门。其首要目标是确保日益强大的AI模型,尤其是大语言模型,以符合人类意图和社会价值观的方式运行。该团队的工作涵盖模型对齐、可解释性和鲁棒性的技术研究,以及建立安全部署实践的政策导向型工作。
该举措源于OpenAI于2015年阐述的创始使命,即开发惠及全人类的人工智能。随着组织在2019年从非营利性转变为封顶盈利结构,安全研究仍是核心支柱,并专门配置了团队和大量计算资源。该团队发表了有影响力的论文,并开发了塑造AI安全领域的工具,影响了学术界研究和行业实践。
技术对齐研究
OpenAI安全研究的核心焦点是技术对齐,即构建可靠地按照人类意图行事的AI系统的挑战。这包括关于从人类反馈中强化学习(RLHF)的工作,这是一种利用人类偏好来微调模型的方法。RLHF在2017年的一篇论文中提出,并在随后几年得到改进,成为训练诸如ChatGPT等模型使其有益且无害的基础方法。其具体方法包括收集模型输出的人类偏好,基于这些比较训练奖励模型,然后使用随机梯度下降的变体针对奖励模型优化策略。
另一个重要领域是可解释性研究,旨在理解神经网络的内部机制。研究人员开发了识别和操纵模型激活空间中特定特征或方向的技术,从而进行更有针对性的干预。例如在2023年发表的稀疏自编码器工作,演示了如何将模型激活分解为可解释组件,为理解模型如何表征欺骗或迎合等概念提供了窗口。该研究方向被认为对在错误行为导致有害结果之前检测和纠正错误行为至关重要。
该团队还研究对抗鲁棒性,探索如何通过精心设计的输入欺骗模型。这包括红队测试和自动生成对抗样本的方法。这些工作的发现为生产系统中部署的安全分类器和过滤机制提供了信息。
规则与治理
除了技术方法,OpenAI安全研究还通过规则分析和部署框架制定为制定AI治理做出贡献。该团队发表过关于AI监管、透明度和负责任的发布等主题的立场论文。2023年OpenAI发布了一个准备框架,概述了基于风险的方法来部署AI系统,将潜在危害分为网络安全、生物和公共安全领域,并提出了相应的缓解策略。
团队还与大型学术机构等外部利益相关者进行接触。内部对AI安全的研究也催生了与其他机构的大语言模型对齐合作,特别是在各AI实验室的合作对识别AI风险和实践对策有重要意义。
主要项目和工具
多个有条件项目的开发从OpenAI安全研究开始走。对齐研究团队在2023年开发了"从弱到强泛化"框架,研究较弱模型如何监督较强模型,以及该框架可能如何通过扩展模型规模来对齐超级AI模型。另一个项目“评估”套件提供安全属性测试的标准化基准,包括真实、避免偏见和拒绝强化分类。这些工具训练于内部分类并用共享到研究社区。
2023年成立了“超级对齐”计划,拥有多年时间表且规定为专门的,全功率对齐超智能AI问题。该计划由首席科学家Jakob Uszkoreit等人顾而讨论人类监督下可扩展的用自己的AI助手检查其他AI模型行为的方法。
影响与反馈
OpenAI安全研究对AI AI安全领域产生了深远持续的影响。成效需要被持续验证,先说SMAs RIItƈ focus is to uplift the public overall, At States scale,OGPs research shows 现场方法成熟,但批评认为先进模型的部署可能超越了研究论证的能效可以足够准确到保证的安全性。该团队的工作也引发了关于邻近科技的抬头生成AI治理更广泛的讨论。到2024年时已经远超所区分出来的功能。
未来方向
展望未来,预计OpenAI安全研究在未来研究上实现稳健的也可扩展的类教练完善和增强可理解的技术,应该处理千亿参数的模型,以及制造跟上迭代安全评估系统。
参考
- OpenAI. (2017). “深度强化学习从人类喜好中借鉴”
- OpenAI. (2023). “受限控制理论:弱到强泛化”
- OpenAI. (2023). “根本能力框架”
- OpenAI. (2023). “超级对齐框架”