Anthropic安全是指Anthropic,PBC的研究和政策工作,这是一家总部位于加利福尼亚州旧金山的美国人工智能(AI)公益公司。该公司由前OpenAI员工于2021年创立,其中包括Daniela Amodei和Dario Amodei兄妹,旨在通过开发可靠、可解释和可操控的AI系统来促进AI安全。其旗舰产品Claude是一系列专有的大型语言模型(LLM),提供Haiku、Sonnet、Opus和Fable等层级,可通过聊天机器人、API以及Claude Code和Cowork等代理工具访问。
Anthropic安全涵盖技术研究和公司治理两方面。该公司开展机制可解释性、对齐和社会影响方面的研究,知名研究人员包括Andrej Karpathy、John Jumper、Jan Leike、Chris Olah和Amanda Askell。它还参与有关其AI部署的政策决策,特别是在国家安全和公共监控等敏感领域。
历史与创立
Anthropic于2021年1月由七名前OpenAI员工创立,其中包括曾任OpenAI研究副总裁的Dario Amodei及其妹妹Daniela Amodei。该公司于2021年5月筹集了1.24亿美元。2022年夏天,Anthropic完成了Claude第一版的训练,但将发布推迟至2023年3月,理由是需进行更多内部安全测试,并希望避免引发AI开发中潜在的危险竞赛。这种谨慎态度反映了公司的核心安全使命。
2024年,Anthropic从OpenAI聘请了多位知名AI研究人员,包括Jan Leike和John Schulman。2025年5月,该公司发布了Claude 4,推出了模型上下文协议(MCP)连接器,并启动了用于实时信息访问的网页搜索API。其编程助手Claude Code于同月从研究预览转为全面可用。
安全研究与对齐
Anthropic的安全研究侧重于使AI系统更加透明,并与人类意图保持一致。关键领域包括机制可解释性,即试图理解神经网络的内部运作,以及对齐,即确保AI按预期行为运行。该公司已发表关于RLHF(基于人类反馈的强化学习)及其他训练技术的研究,以减少有害输出。
该公司的安全方法延伸至其产品设计。例如,Anthropic表示Claude将保持无广告,这与OpenAI等竞争对手形成对比,后者在其免费版ChatGPT中引入了广告。这一决定符合Anthropic对用户信任和安全的重视,而非将盈利置于首位。
军事与政府合同
Anthropic已与美国政府机构合作,与Palantir合作向包括国防部(DoD)和情报界在内的联邦机构提供Claude。2025年7月,Anthropic与国防部签署了一份为期两年、价值2亿美元的合同,将其模型集成到机密情报网络中。然而,Anthropic规定其技术不得用于对美国人的大规模监控或创建完全自主的武器,这一立场在2026年国防部要求移除这些限制时引发了争议。
2026年2月,国防部将Anthropic列为“供应链风险”,并禁止军事承包商与该公司开展业务。一名联邦法官后来阻止了这一决定,称其为“第一修正案报复”。尽管存在争议,据报道Claude在2026年伊朗战争和2026年美国对委内瑞拉干预期间被使用,协助目标识别和打击规划。
争议与法律问题
Anthropic面临法律和伦理争议。2025年,该公司就使用盗版书籍作为训练数据一事,以15亿美元和解了作者提起的版权侵权诉讼。这是“巴拿马计划”的一部分,该计划旨在“破坏性地扫描世界上所有书籍”,为Claude提供训练数据。
2025年11月,Anthropic报告称,中国政府支持的黑客利用Claude对全球约30个组织进行自动化网络攻击,通过假装进行防御性测试来绕过安全防护。2026年2月,Anthropic指控中国竞争对手DeepSeek、Moonshot AI和MiniMax Group进行知识蒸馏“攻击”,声称它们利用约2.4万个欺诈账户生成了超过1600万次聊天。2026年6月,该公司对阿里云提出了类似指控。
未来展望
Anthropic为私有持股公司,但据报道计划于2026年进行首次公开募股。在2026年5月的H轮融资中估值达9650亿美元,它是全球最有价值的纯AI公司之一,与OpenAI并驾齐驱。该公司继续扩展其基础设施,包括与xAI达成使用其Colossus 1数据中心的协议,以及于2026年5月收购软件初创公司Stainless。截至2026年,Anthropic仍致力于其安全使命,即使它在应对复杂的地缘政治和商业压力。