El Centro para la Seguridad de la IA (CAIS) es una organización sin fines de lucro estadounidense con sede en San Francisco que promueve el desarrollo y la implementación seguros de la inteligencia artificial. El trabajo de CAIS abarca la investigación en seguridad técnica de la IA y ética de la IA, la promoción y el apoyo para hacer crecer el campo de investigación de la seguridad de la IA. Fue fundado en 2022 por Dan Hendrycks y Oliver Zhang.
En mayo de 2023, CAIS publicó la declaración sobre el riesgo de extinción por IA, firmada por cientos de profesores de IA, líderes de las principales empresas de IA y otras figuras públicas. La organización opera como un centro para investigadores, responsables políticos y socios de la industria centrados en mitigar los posibles daños de los sistemas avanzados de inteligencia artificial.
Investigación
Los investigadores de CAIS publicaron "Una visión general de los riesgos catastróficos de la IA", que detalla escenarios de riesgo y estrategias de mitigación de riesgos. Los riesgos descritos incluyen el uso de la IA en la guerra autónoma o para la ingeniería de pandemias, así como las capacidades de la IA para el engaño y la piratería informática. Otro trabajo, realizado en colaboración con investigadores de la Universidad Carnegie Mellon, describió una forma automatizada de descubrir ataques adversarios de grandes modelos de lenguaje que eluden las medidas de seguridad, destacando la insuficiencia de los sistemas de seguridad actuales.
La investigación técnica de la organización abarca áreas como la robustez del aprendizaje automático, la interpretabilidad de redes neuronales y la alineación de sistemas de aprendizaje profundo. Los investigadores de CAIS también han examinado los modos de fallo en IA generativa y han propuesto marcos para evaluar capacidades peligrosas antes de su implementación.
Actividades
En 2023, la declaración de CAIS sobre el riesgo de extinción por IA obtuvo el apoyo de Dario Amodei de Anthropic, Sam Altman de OpenAI y otros líderes de la industria de la IA. Ese mismo año, el intercambio de criptomonedas FTX (que quebró en noviembre de 2022) intentó recuperar 6,5 millones de dólares que había donado a CAIS a principios de ese año.
Otras iniciativas incluyen un clúster de computación para apoyar la investigación en seguridad de la IA, un curso en línea titulado "Introducción a la seguridad del aprendizaje automático" y una beca para profesores de filosofía para abordar problemas conceptuales. El Fondo de Acción del Centro para la Seguridad de la IA es patrocinador del proyecto de ley SB 1047 de California, la Ley de Innovación Segura y Protegida para Modelos de Inteligencia Artificial de Frontera.
Promoción y Política
CAIS colabora con responsables políticos a nivel estatal y federal para promover marcos regulatorios para los sistemas de IA de frontera. La organización ha publicado informes sobre temas como las evaluaciones de seguridad de modelos, el aprendizaje por refuerzo a partir de retroalimentación humana y los riesgos de las arquitecturas basadas en transformers. Sus esfuerzos de promoción enfatizan la necesidad de pruebas previas a la implementación y estándares de transparencia.
Construcción de Comunidad
El centro apoya el ecosistema más amplio de seguridad de la IA mediante subvenciones, talleres y colaboraciones con instituciones académicas como Berkeley AI Research y la Universidad de Oxford. También mantiene un directorio de investigadores en seguridad y organiza seminarios regulares que reúnen a expertos de Google DeepMind, Anthropic y otros laboratorios líderes.
Véase También
Referencias
Datos de fuentes de Wikipedia (CC BY-SA).
Enlaces Externos
Sitio web oficial