人工智能安全中心

译自英文

人工智能安全中心(CAIS)是一家总部位于旧金山的非营利组织,成立于2022年,致力于研究和倡导人工智能的安全发展,包括发布风险声明和技术研究。

人工智能安全中心(CAIS)是一家总部位于旧金山的美国非营利组织,致力于促进人工智能的安全开发与部署。CAIS的工作涵盖技术性AI安全与AI伦理研究、倡导宣传,以及支持AI安全研究领域的发展壮大。该组织由Dan Hendrycks和Oliver Zhang于2022年创立。

2023年5月,CAIS发布了关于AI灭绝风险的声明,该声明获得了数百位AI教授、主要AI公司领导者及其他公众人物的签署。该组织作为研究人员、政策制定者和行业合作伙伴的枢纽,专注于减轻先进人工智能系统可能带来的危害。

研究

CAIS研究人员发表了《灾难性AI风险概述》,详细阐述了风险情景和风险缓解策略。所描述的风险包括AI在自主战争或工程化流行病中的使用,以及AI在欺骗和黑客攻击方面的能力。另一项与卡内基梅隆大学研究人员合作开展的工作,描述了一种自动发现大型语言模型对抗性攻击的方法,这些攻击可绕过安全措施,凸显了当前安全系统的不足。

该组织的技术研究涵盖机器学习鲁棒性、神经网络可解释性以及深度学习系统的对齐等领域。CAIS研究人员还考察了生成式AI中的失效模式,并提出了在部署前评估危险能力的框架。

活动

2023年,CAIS关于AI灭绝风险的声明获得了Anthropic的Dario Amodei、OpenAI的Sam Altman及其他AI行业领袖的支持。同年,加密货币交易所FTX(于2022年11月破产)试图追回其当年早些时候捐赠给CAIS的650万美元。

其他举措包括支持AI安全研究的计算集群、名为“Intro to ML Safety”的在线课程,以及面向哲学教授解决概念问题的奖学金项目。人工智能安全中心行动基金是加利福尼亚州SB 1047法案(《前沿人工智能模型安全与创新法案》)的赞助方。

倡导与政策

CAIS与州级和联邦层面的政策制定者合作,推动前沿AI系统的监管框架。该组织发布了关于模型安全评估基于人类反馈的强化学习以及Transformer架构风险等主题的简报。其倡导工作强调部署前测试和透明度标准的必要性。

社区建设

该中心通过资助、研讨会以及与伯克利AI研究牛津大学等学术机构的合作,支持更广泛的AI安全生态系统。它还维护着一个安全研究人员目录,并定期组织研讨会,汇聚来自Google DeepMindAnthropic及其他领先实验室的专家。

参见

参考文献

事实来源:维基百科(CC BY-SA)。

外部链接

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-safety·nonprofit·research-organization·san-francisco
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史