译自英文

AI安全是一个跨学科领域,专注于防止人工智能系统引发的事故、滥用或其他有害后果,涵盖对齐、监控和鲁棒性,并日益关注存在性风险。

AI安全是一个跨学科领域,专注于防止人工智能系统引发的意外事故、滥用或其他有害后果。它涵盖AI对齐,旨在确保AI系统按预期行为运行,监控AI系统以识别风险,并增强其鲁棒性。该领域特别关注先进AI模型带来的生存风险,但也处理近期问题,如偏见、监控和网络威胁。

除了技术研究,AI安全还涉及制定促进安全性的规范和政策,包括在不同层级政府倡导法规。该领域在2023年获得了显著关注,随着生成式AI的快速进展以及研究人员和CEO对潜在危险的公开担忧。在2023年AI安全峰会上,美国和英国均建立了各自的AI安全研究所。然而,研究人员表示担忧,认为AI安全措施未能跟上AI能力快速发展的步伐。

动机

学者们讨论关键系统故障、偏见和AI驱动的监控带来的当前风险,以及新兴风险,如技术性失业、数字操纵、武器化、AI驱动的网络攻击和生物恐怖主义。他们还讨论未来人工通用智能(AGI)代理失控或AI促成永久稳定独裁政权所带来的推测性风险。

生存安全

有些人批评了对AGI的担忧,例如吴恩达在2015年将其比作“担心火星上的人口过剩,而我们尚未踏上该星球”。斯图尔特·J·罗素则主张谨慎,认为“最好预见人类的创造力,而不是低估它”。

AI研究人员对AI技术带来的风险的严重性和主要来源持有广泛不同的观点,,尽管调查表明专家认真对待高后果风险。在两项针对AI研究人员的调查中,中位受访者对AI整体持乐观态度,但将先进AI导致“极其糟糕(例如人类灭绝)”结果的概率设为5%。在2022年对自然语言处理社区的调查中,37%的人同意或略微同意AI决策可能导致“至少与全面核战争一样糟糕”的灾难是合理的。

历史

AI风险在计算机时代初期开始被认真讨论。1951年,艾伦·图灵写道:“此外,如果我们朝着制造能够学习且行为受经验修改的机器方向发展,我们必须面对这样一个事实:我们赋予机器的每一点独立性,都是对我们意愿的可能违抗。”1988年,布莱·惠特比出版了一本书,概述了AI需要沿着伦理和社会责任方向发展的必要性。

从2008年到2009年,人工智能促进协会(AAAI)委托进行了一项研究,以探索和解决AI研究与发展可能带来的长期社会影响。专家组普遍对科幻作家表达的激进观点持怀疑态度,但同意“进一步研究将有助于理解和验证复杂计算系统行为范围的方法,以最小化意外结果”。

2011年,罗曼·扬波利斯基在哲学与人工智能理论会议上引入了“AI安全工程”一词,列出了AI系统以往的失败,并认为“随着AI能力增强,此类事件的频率和严重性将稳步增加”。

2014年,哲学家尼克·博斯特罗姆出版了《超级智能:路径、危险、策略》一书。他认为AGI的崛起有可能引发各种社会问题,从AI取代劳动力、操纵政治和军事结构,到甚至可能导致人类灭绝。他关于未来先进系统可能对人类生存构成威胁的论点促使埃隆·马斯克、比尔·盖茨和斯蒂芬·霍金表达了类似担忧。

2015年,数十位人工智能专家签署了一封关于人工智能的公开信,呼吁研究AI的社会影响并概述具体方向。迄今为止,这封信已有超过8000人签署,包括扬·勒昆、肖恩·莱格、约书亚·本吉奥和斯图尔特·罗素。同年,由斯图尔特·J·罗素教授领导的一组学者在加州大学伯克利分校成立了人类兼容AI中心,未来生命研究所拨款650万美元用于旨在“确保人工智能(AI)保持安全、伦理和有益”的研究。

2016年,白宫科技政策办公室和卡内基梅隆大学宣布举办“人工智能安全与控制公共研讨会”,这是旨在调查AI“优势与劣势”的四个白宫研讨会之一。同年,《AI安全中的具体问题》,,首批且最具影响力的技术性AI安全议程之一,,发表。

2017年,未来生命研究所赞助了阿西洛马尔有益AI会议,会上100多位思想领袖制定了有益AI的原则,包括“避免竞赛:开发AI系统的团队应积极合作,避免在安全标准上偷工减料”。

2018年,DeepMind安全团队概述了规范、鲁棒性和保证方面的AI安全问题。次年,研究人员在ICLR组织了一个研讨会,专注于这些问题领域。2021年,《机器学习安全中的未解决问题》发表,概述了鲁棒性、监控、对齐和系统安全方面的研究方向。

2023年,里希·苏纳克表示他希望英国成为“全球AI安全监管的地理家园”,并主办首届全球AI安全峰会。AI安全峰会于2023年11月举行,重点关注前沿AI模型相关的滥用和失控风险。峰会期间,宣布了创建《先进AI安全国际科学报告》的意向。

2024年,美国和英国在AI安全科学方面建立了新伙伴关系。谅解备忘录于2024年4月1日由美国商务部长吉娜·雷蒙多和英国技术大臣米歇尔·多尼兰签署,以联合开发先进AI模型测试,此前在11月于布莱切利公园举行的AI安全峰会上做出了承诺。

2025年,由约书亚·本吉奥主持的96位专家国际团队发表了首份《国际AI安全报告》。该报告由30个国家和联合国委托,代表了关于先进人工智能潜在风险的首次全球科学审查。它详细说明了源于滥用、故障和社会破坏的潜在威胁,旨在通过基于证据的发现为政策提供信息。

技术方法

技术性AI安全研究涵盖多个子领域。鲁棒性旨在确保AI系统在分布偏移、对抗性攻击和分布外输入下可靠运行。监控涉及检测和预测有害行为,例如使用异常检测或可解释性工具。对齐侧重于使AI系统的目标和行为与人类价值观和意图一致。这包括规范(定义我们想要什么)、保证(验证合规性)和可纠正性(允许修正)。

《AI安全中的具体问题》(2016)确定了五个研究领域:负面副作用、奖励黑客、可扩展监督、安全探索和分布偏移。这些问题仍然是该领域的核心。后续工作扩展到可解释性,旨在理解如大型语言模型等模型的内部机制,以及系统安全,处理多代理交互和社会影响带来的风险。

机构与治理

AI安全研究在学术机构和行业实验室中进行。加州大学伯克利分校的人类兼容AI中心、牛津大学的未来人类研究所和机器智能研究所是著名的学术中心。行业努力包括DeepMind的安全团队、OpenAI的对齐研究和Anthropic的宪法AI方法。美国AI安全研究所和英国AI安全研究所等政府机构于2023年成立,以评估前沿模型。

国际合作有所增长,例如《国际AI安全报告》(2025)和美英伙伴关系等双边协议。然而,治理仍然分散,关于适当监管水平和安全研究相对于能力发展速度的辩论仍在继续。

挑战与批评

AI安全面临多项挑战。技术困难包括指定人类价值观的复杂性、神经网络的不可解释性,以及验证先进系统中对齐的难度。还存在社会挑战,例如竞争环境中安全措施可能被绕过的风险,以及跨学科合作的必要性。

批评者认为,生存风险担忧被夸大,将注意力从偏见和监控等更直接的危害上转移开。其他人则认为安全研究资金不足,且该领域缺乏明确的成功指标。生成式AI的快速发展加剧了这些辩论,一些研究人员呼吁暂停某些发展。

未来方向

未来的AI安全研究可能侧重于可扩展监督、可解释性和对日益强大系统的稳健对齐。能够自我改进的AI的发展引发了关于控制和价值锁定的新问题。国际协调和安全标准的制定将至关重要。随着AI系统更深入地融入社会,该领域将不仅需要解决技术风险,还需要解决伦理、法律和政治维度。

《国际AI安全报告》(2025)强调需要基于证据的政策和持续研究。该领域预计将增长,更多机构和政府投资于安全措施。然而,正如许多专家所指出的,AI能力与安全研究之间的差距仍然是一个担忧。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-safety·artificial-intelligence·existential-risk·technology-policy
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史