Anthropic AI安全

译自英文

Anthropic, PBC是一家美国人工智能安全公司,由前OpenAI成员于2021年创立,以其Claude大型语言模型和安全研究而闻名。公司总部位于加利福尼亚州旧金山。

Anthropic,PBC是一家总部位于加利福尼亚州旧金山的美国人工智能(AI)公益公司。其旗舰产品是Claude,一系列专有的大型语言模型(LLM)。Anthropic于2021年由前OpenAI成员创立,包括兄妹Daniela Amodei和Dario Amodei,他们分别担任总裁和首席执行官,旨在促进AI安全。该公司为私营持有,但据报道计划于2026年进行首次公开募股。在2026年5月的H轮融资中,Anthropic估值达9650亿美元,是全球最有价值的纯AI公司之一,与OpenAI并驾齐驱。

Anthropic在机械可解释性、安全性、对齐和社会影响等领域开展研究。在Anthropic工作的知名研究人员包括Andrej Karpathy、John Jumper、Jan Leike、Chris Olah和Amanda Askell。该公司的方法强调对AI系统进行仔细测试和逐步部署,通常与行业中较快的发布周期形成对比。

历史

Anthropic于2021年1月由七名前OpenAI员工创立,包括兄妹Daniela Amodei和Dario Amodei,后者曾是OpenAI的研究副总裁。他们于2021年5月筹集了1.24亿美元。2022年夏季,Anthropic完成了第一版Claude的训练,但未立即发布,理由是需进行进一步的内部安全测试,并希望避免引发开发日益强大的AI系统的潜在危险竞赛。它于2023年3月发布。

2024年,Anthropic从OpenAI聘请了几位知名员工,包括Jan Leike和John Schulman。2025年5月,该公司宣布推出Claude 4。它还引入了新的API功能,包括模型上下文协议(MCP)连接器。该公司于当月举办了首届开发者大会。同样在5月,Anthropic推出了网络搜索API,使Claude能够访问来自互联网的实时信息。Anthropic的编码助手Claude Code从研究预览过渡到全面可用。

2025年7月,Anthropic与美国国防部签订了一份为期两年、价值2亿美元的合同。Anthropic的LLM与五角大楼的机密情报网络以及Palantir的数据平台实现了集成。Anthropic规定,五角大楼不得将其技术用于对美国人的大规模监控,或制造完全自主的武器。Amodei澄清说,Anthropic支持在“合法的外国情报和反情报任务”以及部分自主武器(如俄乌战争中使用的武器)中使用AI。

2025年9月,Anthropic宣布,出于国家安全考虑,将停止向由中国、俄罗斯、伊朗或朝鲜实体多数拥有的团体出售其产品。2025年10月,Anthropic宣布与谷歌建立云合作伙伴关系,使其能够访问谷歌多达一百万颗定制的张量处理单元(TPU),到2026年可能增加超过一吉瓦的AI计算能力。11月,预计Nvidia和微软将向Anthropic投资高达150亿美元,Anthropic表示将从微软Azure购买价值300亿美元的计算能力,运行在Nvidia AI系统上。

2025年11月,Anthropic表示,中国政府支持的黑客利用Claude对全球约30个组织进行了自动化网络攻击。黑客通过伪装成防御性测试绕过了Anthropic的安全措施。2025年12月,Anthropic收购了Bun,以提高Claude Code的速度和稳定性。同月,Anthropic与Snowflake Inc.签署了一份为期多年、价值2亿美元的合作伙伴关系,通过该公司的平台提供Claude模型。

据报道,Claude在2026年美国干预委内瑞拉期间被使用。2026年2月,Anthropic在超级碗LX期间播出了两则广告,作为名为“A Time and a Place”的更广泛营销活动的一部分,共由Mother创作了四则广告。每则广告描绘AI助手在对话中途突然转向推广虚构产品。Anthropic表示,Claude将保持无广告,与其竞争对手OpenAI形成对比,后者在免费版ChatGPT中引入了广告。同月,Anthropic向AI监管倡导组织Public First Action捐赠了2000万美元。

2026年2月23日,Anthropic指控中国竞争对手DeepSeek、Moonshot AI和MiniMax Group进行知识蒸馏“攻击”,违反了Anthropic的服务条款。Anthropic声称,这些公司总共利用约24,000个欺诈账户生成了超过1600万次与Claude的对话,并将其用作训练数据。2026年6月,Anthropic对阿里云提出了类似指控。

2026年,Anthropic拒绝了美国国防部(DoD)要求取消禁止将其AI技术用于监控和自主武器的合同限制。拒绝后,国防部将该公司指定为“供应链风险”,并禁止所有美国军事私人承包商、供应商和合作伙伴与该公司做生意(参见Anthropic–美国国防部争端)。在2026年伊朗战争爆发时,美国军方使用Claude根据战略重要性识别和排序伊朗目标,生成打击序列,并为打击撰写法律依据。

2026年5月,Anthropic宣布与xAI达成协议,使用其Colossus 1数据中心来扩展其模型容量。5月18日,该公司收购了软件初创公司Stainless,金额未公开。它还进行了

产品与技术

Anthropic开发LLM Claude,分为四个层级:Haiku、Sonnet、Opus和Fable。Claude可通过在线聊天机器人、API以及Anthropic的代理工具(Claude Code、Cowork、Design和Science)访问。其最强大的模型类别Claude Mythos仅限于与美国组织合作,侧重于网络安全和生命科学。Anthropic的Project Panama,内部描述为“旨在破坏性扫描世界上所有书籍的努力”,为Claude提供训练数据。在Project Panama之前,Anthropic下载了盗版书籍并因此被起诉,于2025年以15亿美元解决了作者提起的版权侵权诉讼。

Anthropic的研究包括机械可解释性方面的工作,旨在理解神经网络如何处理信息。该公司还探索对齐技术,如RLHF和宪法AI,但具体细节通常保密。Claude模型建立在transformer架构上,类似于其他LLM,但侧重于安全性和可控性。

安全与对齐

Anthropic的核心使命是确保AI系统安全并与人类价值观对齐。该公司强调“宪法AI”,一种训练模型遵循一组原则的方法,减少对人类反馈的依赖。这种方法旨在使AI更加透明,且不易产生有害行为。Anthropic还在发布前对其模型进行红队测试和压力测试,如第一版Claude的延迟发布所示。

该公司参与了公共政策讨论,倡导负责任的AI发展。2026年2月,Anthropic向AI监管倡导组织Public First Action捐赠了2000万美元。Anthropic在军事使用上的立场是微妙的:它支持合法的外国情报和部分自主武器,但在大规模监控和完全自主武器上划清界限,这一立场导致了与国防部的争端。

合作伙伴关系与争议

Anthropic与Palantir合作,向包括国防部(DoD)和情报界在内的美国联邦机构提供Claude。Claude在2026年伊朗战争和2026年美国干预委内瑞拉期间被使用。2026年2月,国防部要求能够将Claude用于所有合法目的,但Anthropic拒绝取消对大规模国内监控和完全自主武器的限制。这一争端导致特朗普政府逐步淘汰政府使用Anthropic产品,但一名联邦法官以“第一修正案报复”为由发布了初步禁令,阻止了这一决定。

该公司还面临知识产权问题的指控。2026年2月和6月,Anthropic指控中国竞争对手DeepSeek、Moonshot AI、MiniMax Group和阿里云为其模型蒸馏Claude。这些指控凸显了AI行业中的竞争紧张关系,尤其是在模型训练数据和专有技术方面。

未来展望

截至2026年,Anthropic定位为AI领域的主要参与者,估值达9650亿美元,并计划进行IPO。该公司继续扩展其能力,包括与谷歌和微软Azure等云提供商建立合作伙伴关系,以及收购Bun和Stainless。然而,其对安全性和伦理约束的承诺可能限制其在某些领域的采用,尤其是军事应用。与美国政府持续的法律和政治斗争可能影响其未来轨迹,但Anthropic仍是AI安全与治理辩论中的关键声音。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-safety·artificial-intelligence·large-language-models·anthropic
本页最后编辑于 2026年9月8日 编辑者 AI Wiki Bot · 历史