Anthropic Safety se refiere a los esfuerzos de investigación y políticas de Anthropic, PBC, una corporación de beneficio público estadounidense de inteligencia artificial (IA) con sede en San Francisco, California. Fundada en 2021 por exempleados de OpenAI, incluidos los hermanos Daniela Amodei y Dario Amodei, Anthropic tiene como objetivo promover la seguridad de la IA mediante el desarrollo de sistemas de IA fiables, interpretables y dirigibles. Su producto insignia, Claude, es una serie de modelos de lenguaje grandes (LLM) propietarios disponibles en niveles como Haiku, Sonnet, Opus y Fable, y accesibles mediante chatbot, API y herramientas de agente como Claude Code y Cowork.
Anthropic Safety abarca tanto la investigación técnica como la gobernanza corporativa. La empresa realiza estudios sobre interpretabilidad mecanicista, alineación e impacto social, con investigadores notables como Andrej Karpathy, John Jumper, Jan Leike, Chris Olah y Amanda Askell. También participa en decisiones políticas sobre el despliegue de su IA, particularmente en ámbitos sensibles como la seguridad nacional y la vigilancia pública.
Historia y Fundación
Anthropic fue fundada en enero de 2021 por siete exempleados de OpenAI, incluido Dario Amodei, quien había servido como vicepresidente de investigación de OpenAI, y su hermana Daniela Amodei. La empresa recaudó 124 millones de dólares en mayo de 2021. En el verano de 2022, Anthropic completó el entrenamiento de la primera versión de Claude, pero retrasó su lanzamiento hasta marzo de 2023, citando la necesidad de más pruebas de seguridad internas y el deseo de evitar iniciar una carrera potencialmente peligrosa en el desarrollo de la IA. Este enfoque cauteloso refleja la misión central de seguridad de la empresa.
En 2024, Anthropic contrató a varios investigadores notables de IA de OpenAI, incluidos Jan Leike y John Schulman. En mayo de 2025, la empresa anunció Claude 4, introdujo el conector Protocolo de Contexto de Modelo (MCP) y lanzó una API de búsqueda web para acceso a información en tiempo real. Claude Code, su asistente de codificación, pasó de la vista previa de investigación a disponibilidad general ese mismo mes.
Investigación de Seguridad y Alineación
La investigación de seguridad de Anthropic se centra en hacer que los sistemas de IA sean más transparentes y estén más alineados con las intenciones humanas. Las áreas clave incluyen la interpretabilidad mecanicista, que busca comprender el funcionamiento interno de las redes neuronales, y la alineación, que tiene como objetivo garantizar que la IA se comporte según lo previsto. La empresa ha publicado trabajos sobre RLHF (Aprendizaje por Refuerzo a partir de Retroalimentación Humana) y otras técnicas de entrenamiento para reducir resultados dañinos.
El enfoque de la empresa hacia la seguridad se extiende al diseño de sus productos. Por ejemplo, Anthropic ha declarado que Claude permanecerá sin anuncios, contrastando con competidores como OpenAI, que introdujo anuncios en su ChatGPT gratuito. Esta decisión se alinea con el énfasis de Anthropic en la confianza del usuario y la seguridad por encima de la monetización.
Contratos Militares y Gubernamentales
Anthropic ha colaborado con agencias gubernamentales de EE. UU., asociándose con Palantir para proporcionar Claude a organismos federales, incluidos el Departamento de Defensa (DoD) y la Comunidad de Inteligencia. En julio de 2025, Anthropic firmó un contrato de dos años y 200 millones de dólares con el DoD, integrando sus modelos en redes de inteligencia clasificadas. Sin embargo, Anthropic estipuló que su tecnología no se utilizara para vigilancia masiva de estadounidenses ni para crear armas totalmente autónomas, una postura que provocó una disputa en 2026 cuando el DoD exigió la eliminación de estas restricciones.
En febrero de 2026, el DoD designó a Anthropic como un "riesgo de cadena de suministro" y prohibió a los contratistas militares hacer negocios con la empresa. Un juez federal bloqueó posteriormente esta decisión, calificándola de "represalia contra la Primera Enmienda". A pesar de la disputa, se informó que Claude se utilizó durante la guerra de Irán de 2026 y la intervención de Estados Unidos en Venezuela en 2026, donde ayudó en la identificación de objetivos y la planificación de ataques.
Controversias y Cuestiones Legales
Anthropic ha enfrentado controversias legales y éticas. En 2025, la empresa resolvió una demanda por infracción de derechos de autor de autores por 1.500 millones de dólares, relacionada con el uso de libros pirateados para datos de entrenamiento. Esto fue parte del Proyecto Panamá, un esfuerzo para "escanear destructivamente todos los libros del mundo" con el fin de proporcionar datos de entrenamiento para Claude.
En noviembre de 2025, Anthropic informó que hackers patrocinados por el gobierno chino utilizaron Claude para ciberataques automatizados contra unas 30 organizaciones globales, eludiendo las salvaguardas al pretender realizar pruebas defensivas. En febrero de 2026, Anthropic acusó a los competidores chinos DeepSeek, Moonshot AI y MiniMax Group de ataques de "destilación de conocimiento", alegando que generaron más de 16 millones de chats utilizando unas 24.000 cuentas fraudulentas. En junio de 2026, hizo acusaciones similares contra Alibaba Cloud.
Perspectivas Futuras
Anthropic es de propiedad privada, pero según informes planea una oferta pública inicial en 2026. Valorada en 965.000 millones de dólares en una ronda de financiación Serie H de mayo de 2026, es una de las empresas de IA pura más valiosas del mundo, rivalizando con OpenAI. La empresa continúa expandiendo su infraestructura, incluido un acuerdo con xAI para el uso de su centro de datos Colossus 1 y la adquisición de la startup de software Stainless en mayo de 2026. A partir de 2026, Anthropic sigue comprometida con su misión de seguridad, incluso mientras navega por complejas presiones geopolíticas y comerciales.