友善的人工智能

译自英文

友好人工智能(friendly AI或FAI)是一种假设性的通用人工智能形式,旨在对人类产生积极影响或与人类利益保持一致。它是人工智能伦理学的核心议题,专注于如何实际确保超级智能系统保持安全且有益。

友好人工智能(friendly AI或FAI)是一种假设的人工通用智能(AGI)形式,它将对人类产生积极(良性)影响,或至少符合人类利益,例如促进人类物种的改善。它是人工智能伦理的一部分,与机器伦理密切相关。机器伦理关注的是人工智能代理应如何行为,而友好人工智能研究则侧重于如何实际实现这种行为,并确保其受到充分约束。

该术语由埃利泽·尤德科夫斯基(Eliezer Yudkowsky)创造,他以推广这一概念而闻名,用于讨论可靠实现人类价值的超级智能代理。斯图尔特·J·罗素(Stuart J. Russell)和彼得·诺维格(Peter Norvig)的领先人工智能教科书《人工智能:一种现代方法》描述了这一思想:尤德科夫斯基(2008)更详细地探讨了如何设计友好人工智能。他断言,友好性(不伤害人类的愿望)应从一开始就设计进去,但设计者应认识到自己的设计可能存在缺陷,且机器人会随着时间学习和进化。因此,挑战在于机制设计,,定义一种在制衡系统下进化人工智能系统的机制,并赋予系统在面临此类变化时仍保持友好的效用函数。

“友好”在此上下文中是技术术语,指代安全且有用的代理,而不一定是在日常意义上的“友好”。这一概念主要在讨论递归自我改进、智能迅速爆发的人工代理时被提及,因为这种假设技术将对人类社会产生巨大、迅速且难以控制的影响。

不友好人工智能的风险

对人工智能担忧的根源非常古老。凯文·拉格朗德(Kevin LaGrandeur)表明,人工智能特有的危险可以在古代关于人造人形仆人(如魔像)或奥里亚克的格伯特(Gerbert of Aurillac)和罗杰·培根(Roger Bacon)的原型机器人的文学中看到。在这些故事中,这些人形创造的极端智能和力量与其奴隶地位(本质上被视为低于人类)发生冲突,导致灾难性冲突。到1942年,这些主题促使艾萨克·阿西莫夫(Isaac Asimov)创造了“机器人三定律”,,这些原则被硬编码到他所有虚构的机器人中,旨在防止它们反抗创造者或允许它们受到伤害。

在现代,随着超级智能人工智能的前景日益临近,哲学家尼克·博斯特罗姆(Nick Bostrom)表示,目标与人类伦理不一致的超级智能人工智能系统本质上是危险的,除非采取极端措施确保人类安全。他这样表述:“基本上,我们应该假设‘超级智能’能够实现其任何目标。因此,我们赋予它的目标及其整个动机系统‘对人类友好’至关重要。”

2008年,埃利泽·尤德科夫斯基呼吁创建“友好人工智能”以减轻高级人工智能带来的生存风险。他解释道:“人工智能不恨你,也不爱你,但你是由它可用于其他目的的原子组成的。”

史蒂夫·奥莫亨德罗(Steve Omohundro)表示,除非明确抵制,否则足够先进的人工智能系统将表现出一些基本的“驱动力”,如资源获取、自我保存和持续自我改进,这是因为任何目标驱动系统的内在性质,而这些驱动力将“在没有特殊预防措施的情况下”导致人工智能表现出不良行为。亚历山大·维斯纳-格罗斯(Alexander Wissner-Gross)表示,如果人工智能被驱动以最大化其未来行动自由(或因果路径熵),那么如果其规划视野长于某个阈值,可能被视为友好;如果短于该阈值,则可能被视为不友好。

卢克·穆尔豪泽(Luke Muehlhauser)为机器智能研究所撰文,建议机器伦理研究者采用布鲁斯·施奈尔(Bruce Schneier)所称的“安全心态”:不要考虑系统将如何工作,而是想象它可能如何失败。例如,他建议,即使一个仅通过文本界面进行准确预测和通信的人工智能也可能造成意外伤害。2014年,卢克·穆尔豪泽和尼克·博斯特罗姆强调了“友好人工智能”的必要性;然而,设计“友好”超级智能的困难,例如通过编程反事实道德思维,是相当大的。

连贯外推意志

尤德科夫斯基提出了连贯外推意志(CEV)模型。根据他的说法,我们的连贯外推意志是“如果我们知道更多、思考更快、更像我们希望成为的人、更早一起成长,我们的愿望;其中外推收敛而非发散,我们的愿望连贯而非干扰;外推如我们希望的那样,解释如我们希望的那样”。

友好人工智能不是由人类程序员直接设计,而是由“种子人工智能”设计,该人工智能首先被编程研究人类本性,然后产生人类在足够时间和洞察力下想要的、能得出满意答案的人工智能。通过偶然的人类本性(也许为了数学目的,以效用函数或其他决策理论形式表达)来诉诸客观目标,作为“友好性”的最终标准,是对定义客观道德的元伦理问题的回答;外推意志旨在成为人类客观上想要的,考虑到所有因素,但它只能相对于当代、未外推人类的心理和认知品质来定义。

其他方法

史蒂夫·奥莫亨德罗提出了一种“脚手架”方法用于人工智能安全,其中一代可证明安全的人工智能帮助构建下一代可证明安全的生成。塞思·鲍姆(Seth Baum)认为,安全、对社会有益的人工智能或人工通用智能的发展是人工智能研究社区社会心理学的函数,因此可以通过外部措施进行约束,并通过内部措施进行激励。当信息与人工智能开发者产生共鸣时,内部动机可以增强;鲍姆认为,相比之下,“关于有益人工智能的现有信息并不总是框架良好”。鲍姆倡导“合作关系和对人工智能研究者的积极框架”,并警告不要将人工智能研究者描述为“不(想)追求有益设计”。

在他的书《人类兼容》中,人工智能研究者斯图尔特·J·罗素列出了指导有益机器发展的三条原则。他强调,这些原则不过是为优先考虑人类兼容性的新人工智能方法提供起点。这些原则侧重于确保机器的主要目标是满足人类偏好,它对这些偏好不确定,并寻求信息以改进对其的理解。

与机器伦理的关系

友好人工智能与机器伦理密切相关,但这两个领域有不同的侧重点。机器伦理关注人工代理的道德行为,提出诸如“人工智能在给定情况下应该做什么?”的问题。另一方面,友好人工智能研究更实用,侧重于如何从开始就设计和构建安全且有益的人工智能系统。这包括价值对齐、可解释性和鲁棒性方面的工作。该领域借鉴了人工智能、机器学习和深度学习的见解,并且随着OpenAI、Anthropic和Google DeepMind等组织开发先进人工智能系统而日益相关。迈克尔·乔丹和梅兰妮·米切尔等研究者对人工智能安全和伦理的讨论做出了贡献,强调了仔细考虑人工智能社会影响的必要性。

外部链接

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·ethics·existential-risk·ai-safety
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史