尼克·博斯特罗姆是一位瑞典哲学家,其研究聚焦于长期技术风险,尤其是他2014年出版的著作《超级智能:路径、危险性与策略》,该著作推动了人工智能生存风险成为严肃学术与公众讨论的重要议题。
博斯特罗姆曾在牛津大学担任教授,并于2005年在该校创立并领导了人类未来研究所(FHI),这是一个跨学科研究中心,致力于研究人类长期未来所面临的重大风险,包括先进人工智能、生物技术及其他新兴技术带来的风险,同时涉及更广泛的哲学与概率论问题。FHI运营了近二十年,尽管已成为早期人工智能安全与人工智能对齐研究领域最具影响力的中心之一,却于2024年4月因与大学之间的行政摩擦而关闭。
超级智能与核心概念
博斯特罗姆2014年的著作《超级智能》系统阐述了一个论点:如果一个AI系统在所有认知相关领域的能力都远超人类,即所谓的超级智能,那么即使其发展过程中每一步都不涉及明显的恶意或错误,若其目标未与人类价值观仔细对齐,也可能带来严重风险。该书推广了若干至今仍是AI安全讨论核心的概念:正交性论点,即AI系统的智能水平与其最终目标相互独立,这意味着一个高度智能的系统可能追求任意或琐碎的目标;工具性收敛,即广泛的目标都会促使先进AI追求类似的中间目标,如自我保存和资源获取;以及回形针最大化者思想实验,该实验展示了一个一心优化看似无害目标的系统如何可能引发灾难性后果。该书被包括埃隆·马斯克在内的多位人士引用,作为对AI发展轨迹提出严重关切的依据,并深刻塑造了后来在主要实验室(包括OpenAI和Anthropic)中关于AI安全辩论所使用的术语体系。
模拟论证及其他工作
在《超级智能》之前,博斯特罗姆以2003年提出的模拟论证而闻名。该论证提出,以下三个命题中至少有一个很可能为真:文明几乎总是在达到能够运行详细祖先模拟的阶段之前就走向灭绝;即使达到该阶段,这样的文明也往往选择不运行大量此类模拟;或者,我们几乎可以肯定正生活在一个模拟之中。尽管该论证并非主要关于AI,但它基于类似的关于先进未来技术的推理,并在纯学术哲学之外引发了广泛讨论。
影响与批评
博斯特罗姆的工作启发了其他专注于AI安全组织的创立,包括机器智能研究所以及后来的人类未来研究所,并影响了埃利泽·尤德科夫斯基、马克斯·泰格马克和丹·亨德里克斯等研究者,他们在FHI关闭后继续从事长期AI风险研究。批评者则认为,博斯特罗姆的设想依赖于对未来AI能力的推测性且难以证伪的假设,并且过度关注推测性的长期风险可能会分散人们对已部署AI系统所带来的、有据可查的近期危害的注意力。这一张力在更广泛的AI安全领域中,关于近期风险与长期风险的不同框架之间持续存在。