一致外推意志

译自英文

相干外推意志(CEV)是埃利泽·尤德科夫斯基在2004年提出的一个理论性AI对齐框架,描述了人工超级智能如何基于人类偏好的理想化、外推版本而非当前偏好来行动。

一致外推意志(CEV)是人工智能对齐领域的一个理论框架,描述了一种方法,即人工超级智能(ASI)将基于一种仁慈的假设来行动,该假设涉及人类在更博学、更理性、有更多时间思考,并作为一个社会共同成熟的情况下可能想要什么,而非人类当前个体或集体的偏好。该概念由埃利泽·尤德科夫斯基于2004年提出,作为其友好人工智能工作的一部分。

该概念解决了为可能超越人类智能的高级AI系统设定目标的挑战。CEV建议,与其编码一套固定的规则或价值观,ASI应通过外推人类的意志来推导其目标,旨在反映人们在理想认知和道德条件下可能渴望的内容。

概念

CEV提出,高级AI系统应通过外推人类的意志来推导其目标。这意味着将人类偏好聚合并投射到一个过程中,以反映人们在理想认知和道德条件下可能渴望的内容。其目的是确保AI系统不侵犯人类的真正利益;不遵循短暂或信息不足的偏好,也不决定人类意志尚不可预测的问题。

用诗意的语言来说,我们的一致外推意志是我们在知道更多、思考更快、更成为我们希望成为的人、共同成长得更远时的愿望;其中外推是收敛而非发散,我们的愿望是连贯而非相互干扰;外推如我们所愿,解释如我们所愿。

该框架旨在通过捕捉人类价值观的来源而非试图列举它们,从而具有人性和自我纠正性。它避免了制定明确、固定规则列表的困难。它包含了道德成长,防止有缺陷的当前道德信念被锁定。它限制了少数程序员对ASI价值观可能产生的影响,从而也减少了先构建ASI的激励。并且它让人类掌握自己的命运。

辩论

尤德科夫斯基和尼克·博斯特罗姆指出,CEV具有几个有趣的特性,但也面临重大的理论和实践挑战。博斯特罗姆指出,CEV具有“许多自由参数,可以以各种方式指定,产生该提案的不同版本。”其中一个参数是外推基础(考虑谁的外推意志)。例如,是否应包括患有严重痴呆症的人、植物人状态的患者、胎儿或胚胎。他还指出,如果CEV的外推基础仅包括人类,则存在结果对其他动物和数字思维不慷慨的风险。一种可能的解决方案是包括一个机制来扩展CEV的外推基础。

这些辩论是更广泛的AI对齐AI安全讨论的一部分,这些讨论研究如何确保高级AI系统按照人类价值观和利益行事。

变体和替代方案

CEV的一个理论替代方案是依赖人工超级智能的优越认知能力来找出什么是道德正确的,并让它据此行动。也可以结合两种技术,例如ASI遵循CEV,除非在道德上不允许。

在另一篇评论中,一项哲学分析通过自主系统中社会信任的视角探讨了CEV。借鉴安东尼·吉登斯的“积极信任”概念,作者提出了CEV演变为“一致、外推和聚类意志”(CECV)。这一表述旨在更好地反映不同文化群体的道德偏好,从而为设计赢得公众信任并适应社会多样性的AI系统提供更务实的伦理框架。

与其他AI概念的关系

CEV位于更广泛的人工智能研究领域内,特别是在关于如何设计对人类有益系统的讨论中。它与依赖显式基于规则的系统或从人类反馈中学习的方法形成对比,例如RLHF(基于人类反馈的强化学习),后者用于现代大型语言模型。虽然RLHF旨在通过迭代反馈使模型与当前人类偏好对齐,但CEV提出了对这些偏好的更雄心勃勃的外推。

该框架还涉及AI系统中理性和决策的问题。它假设在理想条件下人类会趋同于一套连贯的偏好,这是一个有争议的哲学假设。

参见

外部链接

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-alignment·ai-safety·philosophy-of-ai
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史