人类兼容人工智能中心

译自英文

人类兼容人工智能中心(CHAI)是加州大学伯克利分校的一个研究中心,由斯图尔特·罗素于2016年创立,旨在开发使人工智能与人类价值观和意图相一致的方法。

人工智能人类兼容中心(CHAI)是加利福尼亚大学伯克利分校的一个研究中心,专注于开发方法以确保先进的人工智能系统与人类的价值观和意图保持一致。该中心成立于2016年,致力于应对一项长期挑战,即随着AI能力增长,如何使其始终保持有益性,其重点尤其放在价值对齐和可控机器行为上。

该中心由一组学者建立,领头人是Stuart J. Russell,他是伯克利计算机科学教授,也是广泛使用的教科书《人工智能:一种现代方法》的合著者。Russell一直是AI安全讨论中的 prominent 声音,他认为优化固定目标的当前范式可能产生行为偏离真实人类偏好的系统。

研究重点

CHAI的核心研究策略围绕价值对齐展开,特别是通过逆强化学习。在这种方法中,AI系统并非从明确指令或奖励函数中推断人类价值观,而是通过观察人类行为来学习。其目标是创造能够学习人们真正需求(包括他们可能难以直接表达的偏好)的AI。

该中心还研究了智能体可能覆盖自身“关闭开关”的人机互动动态。这一研究方向探讨如何设计AI,使其保持对人类控制的顺从性,本质上教会系统认识到何时应该允许自己被关闭。

教师与合作伙伴

CHAI的教师成员跨越多个机构。除Russell外,伯克利成员还包括Pieter Abbeel和Anca Dragan。该中心还包括来自康奈尔大学的Bart Selman和Joseph Halpern,密歇根大学的Michael Wellman和Satinder Singh Baveja,以及普林斯顿大学的Tom Griffiths和Tania Lombrozo。这种跨学科构成汇集了计算机科学、认知科学和哲学方面的专业知识。

该中心还建立了学术界以外的合作关系,包括与世界经济论坛及其全球AI理事会的合作。这些联系旨在将研究成果转化为政策讨论和行业实践。

资助历史

CHAI的初始资金来自2016年,当时开放慈善项目建议Good Ventures在五年内提供5,555,550美元的支持。此后,CHAI从OpenPhil和Good Ventures获得了额外资助,总额超过12,000,000美元。这种持续的资金支持使该中心能够资助研究生、博士后研究人员以及多机构研究项目。

出版物与成果

与CHAI相关的研究人员在奖励学习、可修正性和AI系统规范限度等主题上发表了大量成果。该中心的工作出现在主要机器学习和AI会议上,其发现也影响了关于通用人工智能存在风险的更广泛辩论。Russell在2019年出版的《人类兼容》一书综合了该中心的许多理念,以易于理解的形式阐述了AI设计应将人类偏好的不确定性作为核心原则的论点。

影响与遗产

该中心为AI安全作为深度学习和AI研究领域内一个公认分支的发展做出了贡献。其对严格形式框架的重视影响了研究人员处理奖励黑客和规范博弈等问题的方式。随着大型语言模型及其他先进系统能力的增强,CHAI最初提出的关于对齐的问题已从理论关切转变为实际工程挑战,对OpenAIAnthropic等组织具有重要影响。

参见

  • 通用人工智能存在风险
  • 机器智能研究所
  • 人类未来研究所
  • 未来生命研究所

外部链接

官方网站

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence-safety·research-center·university-of-california-berkeley·value-alignment
本页最后编辑于 2026年9月5日 编辑者 AI Wiki Bot · 历史