Seguridad de la IA

Traducido del inglés

La seguridad de la IA es el campo interdisciplinario dedicado a prevenir daños causados por sistemas de inteligencia artificial, abarcando desde problemas a corto plazo como el sesgo y el mal uso hasta preocupaciones a largo plazo sobre la pérdida de control de sistemas altamente capaces.

La seguridad de la IA es el campo interdisciplinario que se ocupa de prevenir daños causados por sistemas de inteligencia artificial, abarcando problemas a corto plazo como el sesgo, la desinformación y el mal uso, hasta preocupaciones a largo plazo sobre si los humanos mantendrían un control significativo sobre sistemas futuros altamente capaces. Se basa en la investigación de aprendizaje automático, políticas y filosofía, y sus practicantes discrepan entre sí sobre qué riesgos merecen más atención, una división que a menudo se describe informalmente como seguridad "a corto plazo" frente a "a largo plazo".

Alcance

El trabajo de seguridad de la IA a corto plazo aborda problemas visibles en los sistemas desplegados hoy: modelos que producen declaraciones falsas o fabricadas, un fallo conocido como alucinación; sistemas que pueden ser manipulados mediante inyección de indicaciones o un escape para ignorar sus instrucciones; y el desafío más amplio de construir salvaguardas que filtren o bloqueen salidas dañinas sin hacer que un sistema sea inutilizable. El trabajo de seguridad de la IA a largo plazo se preocupa por el riesgo existencial de la IA, incluida la posibilidad de que un sistema que se acerque a la inteligencia artificial general o la superinteligencia pueda perseguir objetivos desalineados con los intereses humanos de maneras difíciles de revertir. Ambas vertientes tratan la alineación, el problema de hacer que el comportamiento real de un sistema coincida con las intenciones de sus diseñadores, como fundamental.

Historia e instituciones

La investigación organizada sobre seguridad de la IA creció sustancialmente después de la expansión de los grandes modelos de lenguaje a principios de la década de 2020. Anthropic fue fundada en 2021 por ex investigadores de OpenAI en parte para perseguir investigaciones de seguridad que consideraban requerían construir y estudiar modelos fronterizos directamente. Instituciones académicas y sin fines de lucro como el Instituto de Investigación de Inteligencia de Máquinas y el Centro para la Seguridad de la IA, asociados con investigadores como Eliezer Yudkowsky y Dan Hendrycks, han argumentado que tratar los riesgos extremos de la IA avanzada como una posibilidad seria; en 2023, el centro de Hendrycks publicó una declaración de una sola frase, firmada por líderes de los principales laboratorios, que pedía tratar el riesgo de extinción por IA como una prioridad global comparable a pandemias y guerras nucleares. Los gobiernos respondieron con nuevas instituciones y acuerdos, incluida la Declaración de Bletchley en la primera Cumbre de Seguridad de la IA del Reino Unido en noviembre de 2023, institutos nacionales de seguridad de la IA en el Reino Unido y los EE. UU., y regulaciones vinculantes como el Acta de IA de la UE.

Técnicas

Las técnicas prácticas de seguridad incluyen el equipo rojo, en el que los evaluadores intentan deliberadamente provocar comportamientos dañinos antes de que un sistema se despliegue; la investigación de interpretabilidad, que intenta comprender los cálculos internos de un modelo en lugar de juzgarlo solo por sus salidas; el aprendizaje por refuerzo a partir de retroalimentación humana y la IA constitucional, que moldean el comportamiento del modelo durante el entrenamiento; y marcos de evaluación que prueban capacidades peligrosas como la capacidad de ayudar con ciberataques o el diseño de armas biológicas. Algunos laboratorios han publicado umbrales de capacidad que activan salvaguardas adicionales a medida que los modelos se vuelven más capaces, una práctica reflejada en marcos como la política de escalado responsable de Anthropic.

Debate

Los críticos de un lado argumentan que el marco existencial desvía la atención y la financiación de daños concretos y presentes, como el sesgo algorítmico, el desplazamiento laboral y el costo ambiental de las ejecuciones de entrenamiento. Los críticos del otro lado, incluidos algunos investigadores de seguridad de la IA, argumentan que los compromisos voluntarios de los laboratorios que compiten por construir sistemas cada vez más capaces son insuficientes sin una aplicación externa, y que la presión competitiva entre empresas y países socava las promesas de seguridad hechas en público. El campo también enfrenta un problema básico de medición: a diferencia de las industrias críticas para la seguridad con décadas de datos de incidentes, no hay una forma establecida de cuantificar la probabilidad de los daños que el trabajo de seguridad de la IA pretende prevenir, lo que mantiene sin resolver el debate subyacente sobre las prioridades.

Categorías:ai-safety·ai-governance·alignment
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial