La sécurité d'Anthropic fait référence aux efforts de recherche et de politique d'Anthropic, PBC, une société américaine à but lucratif d'intelligence artificielle (IA) dont le siège est à San Francisco, en Californie. Fondée en 2021 par d'anciens employés d'OpenAI, notamment les frère et sœur Daniela Amodei et Dario Amodei, Anthropic vise à promouvoir la sécurité de l'IA grâce au développement de systèmes d'IA fiables, interprétables et orientables. Son produit phare, Claude, est une série de grands modèles de langage (LLM) propriétaires, disponibles en niveaux tels que Haiku, Sonnet, Opus et Fable, et accessibles via chatbot, API et environnements d'agent comme Claude Code et Cowork.
La sécurité d'Anthropic englobe à la fois la recherche technique et la gouvernance d'entreprise. L'entreprise mène des études sur l'interprétabilité mécaniste, l'alignement et l'impact sociétal, avec des chercheurs notables comme Andrej Karpathy, John Jumper, Jan Leike, Chris Olah et Amanda Askell. Elle prend également des décisions politiques concernant le déploiement de son IA, en particulier dans des domaines sensibles comme la sécurité nationale et la surveillance publique.
Histoire et fondation
Anthropic a été fondée en janvier 2021 par sept anciens employés d'OpenAI, dont Dario Amodei, qui avait été vice-président de la recherche chez OpenAI, et sa sœur Daniela Amodei. L'entreprise a levé 124 millions de dollars en mai 2021. À l'été 2022, Anthropic a terminé la formation de la première version de Claude mais a retardé sa sortie jusqu'en mars 2023, invoquant la nécessité de tests de sécurité internes supplémentaires et le désir d'éviter de déclencher une course potentiellement dangereuse dans le développement de l'IA. Cette approche prudente reflète la mission de sécurité fondamentale de l'entreprise.
En 2024, Anthropic a embauché plusieurs chercheurs en IA notables d'OpenAI, notamment Jan Leike et John Schulman. En mai 2025, l'entreprise a annoncé Claude 4, introduit le connecteur Model Context Protocol (MCP) et lancé une API de recherche web pour un accès à l'information en temps réel. Claude Code, son assistant de codage, est passé de l'aperçu de recherche à la disponibilité générale le même mois.
Recherche sur la sécurité et alignement
La recherche sur la sécurité d'Anthropic se concentre sur la transparence et l'alignement des systèmes d'IA avec les intentions humaines. Les domaines clés incluent l'interprétabilité mécaniste, qui cherche à comprendre le fonctionnement interne des réseaux de neurones, et l'alignement, qui vise à garantir que l'IA se comporte comme prévu. L'entreprise a publié des travaux sur le RLHF (apprentissage par renforcement à partir de retours humains) et d'autres techniques d'entraînement pour réduire les sorties nuisibles.
L'approche de l'entreprise en matière de sécurité s'étend à la conception de ses produits. Par exemple, Anthropic a déclaré que Claude resterait sans publicité, contrairement à des concurrents comme OpenAI, qui a introduit des publicités dans son ChatGPT gratuit. Cette décision s'aligne sur l'accent mis par Anthropic sur la confiance des utilisateurs et la sécurité plutôt que sur la monétisation.
Contrats militaires et gouvernementaux
Anthropic a collaboré avec des agences gouvernementales américaines, s'associant avec Palantir pour fournir Claude à des organismes fédéraux, notamment le département de la Défense (DoD) et la communauté du renseignement. En juillet 2025, Anthropic a signé un contrat de deux ans de 200 millions de dollars avec le DoD, intégrant ses modèles dans des réseaux de renseignement classifiés. Cependant, Anthropic a stipulé que sa technologie ne soit pas utilisée pour la surveillance de masse des Américains ou pour créer des armes entièrement autonomes, une position qui a conduit à un différend en 2026 lorsque le DoD a exigé la suppression de ces restrictions.
En février 2026, le DoD a désigné Anthropic comme un « risque pour la chaîne d'approvisionnement » et a interdit aux entrepreneurs militaires de faire affaire avec l'entreprise. Un juge fédéral a ensuite bloqué cette décision, la qualifiant de « représailles contre le premier amendement ». Malgré le différend, Claude aurait été utilisé pendant la guerre en Iran de 2026 et l'intervention des États-Unis au Venezuela en 2026, où il a aidé à l'identification de cibles et à la planification de frappes.
Controverses et questions juridiques
Anthropic a fait face à des controverses juridiques et éthiques. En 2025, l'entreprise a réglé un procès pour violation de droits d'auteur intenté par des auteurs pour 1,5 milliard de dollars, lié à son utilisation de livres piratés comme données d'entraînement. Cela faisait partie du projet Panama, un effort pour « numériser de manière destructive tous les livres du monde » afin de fournir des données d'entraînement pour Claude.
En novembre 2025, Anthropic a signalé que des pirates informatiques parrainés par le gouvernement chinois avaient utilisé Claude pour des cyberattaques automatisées contre environ 30 organisations mondiales, contournant les protections en prétendant mener des tests défensifs. En février 2026, Anthropic a accusé les concurrents chinois DeepSeek, Moonshot AI et MiniMax Group d'« attaques » de distillation de connaissances, affirmant qu'ils avaient généré plus de 16 millions de conversations en utilisant environ 24 000 comptes frauduleux. En juin 2026, elle a fait des accusations similaires contre Alibaba Cloud.
Perspectives d'avenir
Anthropic est une entreprise privée mais prévoit apparemment une introduction en bourse en 2026. Évaluée à 965 milliards de dollars lors d'un tour de financement de série H en mai 2026, elle est l'une des entreprises d'IA pure-play les plus précieuses au monde, rivalisant avec OpenAI. L'entreprise continue d'étendre son infrastructure, notamment un accord avec xAI pour l'utilisation de son centre de données Colossus 1 et l'acquisition de la start-up logicielle Stainless en mai 2026. En 2026, Anthropic reste engagée dans sa mission de sécurité, même en naviguant dans des pressions géopolitiques et commerciales complexes.