人工智能带来的存在风险

译自英文

关于足够先进的人工智能可能导致人类灭绝或不可逆转的文明崩溃的论点,以及围绕这种可能性组织起来的研究和倡导。

人工智能带来的生存风险,指的是这样一种论点:足够先进的人工智能可能导致人类灭绝或文明不可逆转的崩溃,以及围绕识别、衡量和缓解这种可能性而组织起来的研究和倡导活动。它是更广泛的人工智能安全领域的一个子集,并与关于超级智能对齐的辩论有大量重叠。

核心论点

核心论点认为,一个能力足够强大的人工智能系统,如果追求的目标与人类价值观不完全一致,就可能造成灾难性伤害,这不一定出于恶意,而是作为优化一个错误指定目标的副作用,这种失败模式有时被称为奖励黑客。支持者认为,一个具有足够广泛能力和自主性的系统,特别是能够规划和利用外部工具的系统,可能会将抵抗纠正或关闭作为一种工具性有用的子目标,无论其最终目标是什么,这一主张被称为工具性趋同。怀疑者则反驳说,这种推理链条依赖于关于能力、目标导向性和自主性在真实系统中将如何发展的未经证实的假设。

主要支持者

哲学家尼克·博斯特罗姆通过2002年一篇关于生存风险的论文和2014年关于超级智能的著作,奠定了早期的学术基础。研究员埃利泽·尤德科夫斯基创立了机器智能研究所,十多年来一直主张,错位的超级智能代表一种严重且被低估的威胁,并倡导对前沿人工智能开发实施严格的国际管控。计算机科学家丹·亨德里克斯是MMLU知识基准的作者,他通过人工智能安全中心指导研究,致力于量化和传播灾难性风险。深度学习先驱约书亚·本吉奥杰弗里·辛顿(后者于2023年离开谷歌)都公开表示,人工智能能力的提升增加了严重风险(包括生存风险)的可能性。

2023年声明与暂停信

公众关注在2023年通过两份重要文件得以具体化。3月,未来生命研究所的暂停信呼吁暂停训练比GPT-4更强大的人工智能系统六个月,收集了数千名签署人,包括知名研究人员和技术专家,尽管一些签署人自己并未暂停开发。5月,人工智能安全中心发布了一份一句话声明:“减轻人工智能带来的灭绝风险,应成为与流行病和核战争等其他社会规模风险并列的全球优先事项”,该声明由数百名人工智能研究人员和高管签署,包括OpenAI谷歌DeepMindAnthropic的领导者。

反对意见与怀疑论

著名的怀疑者包括扬·勒昆,他认为鉴于当前系统的局限性,生存风险框架是推测性的且为时过早;以及加里·马库斯,他批评了末日情景背后的技术假设,以及那些同时警告灾难性风险却竞相构建更强大系统的实验室的动机。包括蒂姆尼特·格布鲁和艾米丽·本德在内的批评者认为,关注假设性的长期灭绝风险,会转移人们对有据可查的近期危害(如有偏见的输出、劳动力替代以及权力集中在少数公司手中)的注意力和资源。

政策回应

生存和灾难性风险框架影响了政府政策,包括英国2023年在人工智能安全峰会上由28个国家签署的布莱切利宣言,以及欧盟人工智能法规中关于最强通用模型系统性风险的条款。包括Anthropic和OpenAI在内的几家前沿实验室发布了内部风险管理框架,有时称为负责任扩展政策,承诺在模型跨越定义的风险阈值时采取与能力挂钩的保障措施。

分类:ai-safety·policy
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史