美国人工智能安全涵盖美国联邦政府为理解和减少人工智能潜在危害所制定的政策、机构及技术项目。随着先进机器学习系统(包括大型语言模型和生成式人工智能工具)能力增强并广泛部署,这些努力不断加大。该路径结合了自愿性行业承诺、联邦研究与评估以及监管指导,重点关注偏见与滥用等近期风险,以及自主系统相关的长期担忧。
联邦协调与机构
美国人工智能安全的核心要素是美国人工智能安全研究所(AISI),该所于2023年在美国国家标准与技术研究院(NIST)内设立。AISI负责对前沿AI模型进行测试与评估,制定安全指南,并与国际同行开展合作。它源于拜登政府2023年10月关于安全、可靠和可信赖地开发与使用人工智能的行政命令,该命令指示NIST建立这一机构。命令还要求对关键基础设施进行风险评估,并要求最强大模型的开发者向政府提交安全测试结果。
除AISI外,白宫还设立了AI特别工作组,随后又在国土安全部下设立了AI安全与保障委员会。这些机构汇聚了来自国防部、能源部和国家科学基金会等部门的官员,其工作包括评估AI在能源、医疗和交通等领域的应用,以及确保联邦采购的AI系统符合安全标准。
自愿承诺与行业参与
美国政府高度依赖与主要AI开发者的自愿协议。2023年7月,白宫从OpenAI、Anthropic、Google DeepMind等领先公司获得了实施外部红队测试、对AI生成内容进行水印标记及共享安全事件信息的承诺。这些承诺之后,2024年又有更广泛的承诺出台,涵盖发布前模型评估及投资网络安全等议题。
尽管这些协议不具法律约束力,却塑造了行业实践。AISI还直接与公司合作,对前沿模型进行发布前评估,结果有时会在安全报告中公布。这种协作模式旨在平衡创新与监督,然而批评者认为自愿性措施缺乏执行机制。
技术研究与评估
美国AI安全包含对衡量和提升模型安全性的技术研究的大量投资。NIST制定了AI风险管理框架,这是一套自定性的风险识别与管理指南。AISI的测试协议涵盖有害内容生成、偏见、模型协助网络攻击或制造生物武器的潜力等领域。
联邦机构在可解释性、稳健性和对齐等AI安全议题上资助学术研究。国家科学基金会推出了支持AI社会影响研究的项目,而国防高级研究计划局(DARPA)则探索了验证和确认AI系统的方法。这些努力旨在开发能够检测模型行为不可预测或偏离其预期目的的工具。
立法与监管格局
美国AI安全通过行政措施和拟议立法的结合不断演变。截至2025年,国会尚未通过全面的AI安全立法,但已引入若干法案,包括要求对高风险AI应用进行影响评估、设立联邦AI监督机构以及强制执行训练数据披露的提案。加利福尼亚州和科罗拉多州等地的州级举措也引入了透明度和风险管理要求,但各州之间差异显著。
各监管机构在现有权限内采取了行动。联邦贸易委员会调查了虚假AI行为,平等就业机会委员会发布了有关算法招聘的指南,消费者金融保护局则处理了AI在贷款中的使用问题。这些行动反映了行业逐部门法而非统一的联邦法规。
国际合作与挑战
美国AI安全努力与国际合作密切相关。美国参与了国际AI安全研究所网络,这是一个于2024年启动的联盟,包括英国、欧盟及其他国家。该网络促进多边测试的实施及最佳实践的分享。美国还参与了七国集团和联合国等多边论坛,推动共同原则。
挑战依然严峻。AI开发的快速发展常常超越项目进程,而美国治理的分权性质意味着联邦指南的落地可能不适用于所有参与者。此外,关于如何定义和衡量通过Deep learning和强化学习演进的系统的“安全性”,仍存在持续争论。截至2025年,美国将继续完善其做法,在促进人工智能创新的同时维护公众福祉。