El Instituto de Seguridad de IA de EE. UU. (AISI), establecido en 2023 dentro del Instituto Nacional de Estándares y Tecnología (NIST), realiza investigaciones destinadas a garantizar el desarrollo y despliegue seguros de sistemas avanzados de inteligencia artificial. Su agenda de investigación abarca evaluaciones técnicas, red-teaming y el desarrollo de estándares de medición para las capacidades y riesgos de la IA. El instituto colabora con instituciones académicas, socios industriales y organismos internacionales para abordar los desafíos planteados por la IA generativa y otras tecnologías emergentes.
La investigación del AISI se fundamenta en la creencia de que las pruebas rigurosas y empíricas son esenciales para comprender el comportamiento, las limitaciones y los posibles daños de los sistemas de IA. El trabajo del instituto informa recomendaciones de políticas y mejores prácticas para los desarrolladores de IA, con un enfoque en los modelos frontera que presentan capacidades avanzadas en áreas como los modelos de lenguaje grandes y el aprendizaje profundo.
Evaluaciones técnicas y red-teaming
Un componente central de la investigación del AISI implica diseñar y llevar a cabo evaluaciones técnicas de modelos de IA. Estas evaluaciones prueban capacidades peligrosas, incluidos el ciberataque, la creación de amenazas biológicas y la replicación autónoma. Los investigadores emplean metodologías de red-teaming, donde equipos intentan provocar respuestas dañinas o eludir las medidas de seguridad. En 2024, el AISI publicó un marco para evaluar modelos de IA de frontera, que incluye parámetros de referencia estandarizados y protocolos depruebas adversarias. El instituto también desarrolla herramientas para la evaluación automatizada, permitiendo evaluaciones escalables del comportamiento del modelo en diversos escenarios.
Normas y directrices de seguridad
El AISI contribuye al desarrollo de normativas y directrices de seguridad para los sistemas de IA. Esto incluye definir métricas para la defensa, la equidad y la transparencia, además de establecer medidas mejores para el registro y la implementación de modelos. El instituto colabora con organizaciones de normalización para crear normas internacionalmente reconocidas, como el Marco de Gestión de Riesgos de IA del NIST, que ofrece un enfoque estructurado para la gestión de riesgos de IA. La investigación en este ámbito explora y confirma la efectividad de técnicas como poda de modelos y aumento de datos en la mejora de la seguridad y la fiabilidad de los modelos.
Colaboración y asociaciones
El AISI colabora con instituciones de investigación líderes en IA, incluidos MIT CSAIL, Stanford AI Lab y Berkeley AI Research, así como con actores de la industria como OpenAI, Anthropic y Google DeepMind. Estas colaboraciones facilitan el acceso a modelos y experiencia de vanguardia, permitiendo que el AISI realice pruebas previas a la implementación de sistemas de frontera. El instituto también se compromete con contrapartes internacionales, como el Instituto de Seguridad de IA del Reino Unido, para armonizar los enfoques de evaluación y compartir resultados. En 2024, el AISI anunció una colaboración con la Universidad Carnegie Mellon para desarrollar nuevos métodos de verificación de la seguridada de sistemas de IA.
Contribuciones a la política y participación pública
La investigación del AISI informa directamente las decisiones de política y el diálogo público sobre la seguridada de IA. El instituto publica informes y resúmenes que condensan sus hallazgos y formulan recomendaciones para reguladores y legisladores. También organiza talleres y conferencias para fomentar el diálogo entre los implicados, incluidas la sociedad civil y los académicos. El trabajo del AISI ha influido en órdenes ejecutivas y propuestas legislativas relacionadas con la supervisión de la IA, subrayando la necesidad de una regulación basada en evidencia. El instituto mantiene un repositorio público de resultados de evaluaciones y de investigación en seguridada, promoviendo la transparencia y la responsabilidad.
Direcciones futuras
De cara al futuro, el AISI planea expandir su investigación en áreas como la interpretabilidad, la alineación y los impactos sociales de la IA. El instituto explora el uso de laentrenamiento por refuerzo con retroalimentación humana (RLHF) y otras técnicas para mejorar la alineación de los modelos con los valores humanos. Además, el AISI investiga los riesgos potenciales de la inteligencia artificial general y las preocupaciones de seguridad a largo plazo. A medida que la tecnología de IA evoluciona, el AISI aspira a mantenerse a la vanguardia de la investigación de seguridad, adaptando sus métodos para enfrentar nuevos desafíos y asegurar que la IA beneficia a la sociedad mientras minimiza los daños.