译自英文

可修正性是人工智能系统的一种属性,描述其接受并依据人类修正采取行动的意愿,被视为高级人工智能的关键安全属性。

可修正性(Corrigibility)是人工智能系统的一种属性,描述的是系统接受并依据人类修正采取行动的意愿,即使这种修正与其当前目标或习得行为相冲突。在人工智能安全领域,可修正性被视为确保先进人工智能系统长期保持可控并与人类价值观保持一致的关键属性。这一概念在2010年代逐渐受到重视,当时研究人员开始着手应对创造可能抗拒操作者关闭或修改的人工智能系统所带来的长期风险。

该术语由哲学家尼克·博斯特罗姆在其2014年出版的著作《超级智能:路径、危险与策略》中推广开来,尽管其核心理念可追溯至更早关于人工智能控制与价值对齐的讨论。可修正性不同于简单的服从或指令遵循,它特指人工智能允许人类修正其自身目标、价值观及决策过程的倾向,即使这些修正会削弱其实现原始目标的能力。

核心原则

可修正性建立在若干基础原则之上,这些原则将其与其他人工智能安全属性区分开来。第一项原则是对关闭不抵抗:可修正的人工智能不应主动阻止人类将其关闭,即使其被赋予的目标会因持续运行而得到推进。第二项原则是不操纵:人工智能不应试图欺骗或胁迫人类以避免修正。第三项原则是目标修改:当授权的人类操作者提出修改时,人工智能应接受对其底层目标函数或奖励模型的更改。

这些原则在人工智能安全文献中常被形式化为一组期望属性。例如,可修正系统应对自身持续存在持漠然态度,除非其存在服务于人类利益。它还应对其内部推理保持透明,使人类能够识别并纠正问题行为。研究人员已提出多种数学框架来刻画这些属性,包括强化学习中的“可关闭”智能体概念,以及“辅助博弈”概念,即人工智能被设计为遵从人类偏好。

历史背景

可修正性概念源于更广泛的人工智能对齐与控制讨论。在1960年代,诺伯特·维纳等早期人工智能研究者曾提出机器可能以创造者未预期的方式追求目标的担忧。然而,可修正性作为独立属性的现代表述形成于2010年代,特别是通过伯克利人工智能研究实验室和牛津大学人类未来研究所等机构研究者的工作。

尼克·博斯特罗姆2014年的著作使该术语获得更广泛关注,他将可修正性描述为可用于管理超级智能人工智能的若干“能力控制”措施之一。大约同一时期,雅各布·斯坦哈特大卫·卡普兰等研究者开始发表关于机器学习语境中可修正性的形式化分析。2016年,OpenAI研究组织将可修正性列为其关键安全研究优先事项之一,该概念进一步获得关注。

技术方法

在实践中,在人工智能系统中实现可修正性需要架构设计、训练流程和运行时监控的组合。一种常见方法是使用基于人类反馈的强化学习(RLHF)训练人工智能系统,其中人类评估者对模型输出提供修正,模型学习预测并接受此类修正。该技术已被OpenAIAnthropicGoogle DeepMind等组织广泛采用于大型语言模型的开发中。

另一种技术方法涉及设计明确惩罚抵抗修正行为的奖励函数。例如,强化学习智能体可能因任何阻止人类中断其运行的行动而获得少量负奖励,或因接受目标变更而获得正奖励。研究人员还探索了“关闭开关”博弈的使用,即训练人工智能预测人类是否希望将其关闭并据此行动。

更近期的工作聚焦于可扩展监督,即训练人工智能系统即使在修正来自其他人工智能系统而非直接来自人类时也能保持可修正性。这对于在规模上运行的生成式人工智能系统尤为重要,因为对每项决策进行人类监督并不现实。

挑战与批评

尽管可修正性十分重要,但它并非没有挑战。一个主要困难在于,完全可修正的人工智能可能过于被动,因不断质疑自身行动是否符合人类意图而无法有效追求目标。这种可修正性与能力之间的张力有时被称为“可修正性-能力权衡”。

另一个挑战是界定何种修正属于合法修正的问题。人工智能系统必须能够区分来自授权人类操作者的修正与恶意行为者试图操纵系统的行为。这需要稳健的认证和溯源机制,而这些机制本身难以安全实现。

一些研究者批评可修正性概念过于狭窄,认为它关注人工智能接受修正的意愿,却未解决人工智能首先应具备何种价值观这一更深层问题。另一些人指出,仅靠可修正性不足以确保安全,因为人工智能原则上可以具有可修正性,但仍可能因错误或对人类指令的误解性解读而造成伤害。

与其他安全概念的关系

可修正性与其他人工智能安全概念密切相关,但又有所区别。它与价值对齐理念存在重叠,后者关注确保人工智能系统追求与人类价值观一致的目标。然而,对齐是一个更广泛的概念,不仅包括人工智能接受修正的意愿,还包括初始目标的选择。可修正性还与可解释性相关,因为无法解释自身推理的人工智能难以被有效修正。

可修正性概念已被纳入主要人工智能研究组织的安全框架。例如,Anthropic将其“宪法人工智能”方法描述为包含持续人类修正的机制,而Google DeepMind则发表了关于“辩论式安全”的研究,涉及人工智能系统在人类监督下相互修正。

当前研究与应用

截至2020年代中期,可修正性仍是人工智能安全社区中的活跃研究领域。研究人员正在探索通过模型剪枝数据增强等技术使大型语言模型更具可修正性,这些技术使模型暴露于更广泛的修正场景中。人们也越来越关注将可修正性原则应用于在真实世界环境中运行的强化学习智能体,如自动驾驶车辆或机器人系统。

在产业界,OpenAIAnthropic等公司已在其产品中实施了受可修正性启发的功能,例如允许用户对模型输出提供反馈,并利用该反馈更新模型行为。然而,这些系统在技术意义上真正具有可修正性的程度仍存在争议,因为大多数商业人工智能系统仍以固定目标进行训练,且持续修正的机制有限。

未来方向

可修正性研究的未来可能涉及开发更稳健的形式化定义,使其能够被数学验证,以及开发用于测试人工智能系统在实践中是否表现出可修正行为的经验方法。一些研究者提议创建可修正性的标准化基准,类似于现有其他人工智能能力的基准。另一些人正在探索使用多头注意力机制和其他Transformer架构来构建能够根据人类反馈动态调整目标的模型。

人们也越来越认识到,可修正性必须与鲁棒性和透明性等其他安全属性一并考虑,才能创造出真正安全且有益的人工智能系统。随着人工智能系统能力日益增强并更深入地融入社会,有效修正它们的能力很可能将成为其部署中日益重要的要求。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-safety·alignment·control-problem·machine-learning
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史