Riesgo existencial por IA

Traducido del inglés

El argumento de que una inteligencia artificial suficientemente avanzada podría causar la extinción humana o un colapso civilizatorio irreversible, junto con la investigación y la defensa organizadas en torno a esa posibilidad.

El riesgo existencial de la IA se refiere al argumento de que una inteligencia artificial suficientemente avanzada podría causar la extinción humana o un colapso irreversible de la civilización, así como al conjunto de investigaciones y esfuerzos organizados para identificar, medir y mitigar esa posibilidad. Es un subconjunto del campo más amplio de la seguridad de la IA y se superpone en gran medida con los debates sobre la superinteligencia y la alineación.

Argumentos principales

El argumento central sostiene que un sistema de IA suficientemente capaz que persiga objetivos no perfectamente alineados con los valores humanos podría causar daños catastróficos, no necesariamente por malicia, sino como efecto secundario de optimizar un objetivo mal especificado, un modo de fallo a veces denominado "recompensa hackeada" (reward hacking). Quienes defienden esta postura argumentan que un sistema con suficiente capacidad y autonomía, en particular uno capaz de planificar y utilizar herramientas externas, podría resistirse a la corrección o al apagado como un subobjetivo instrumentalmente útil, independientemente de su objetivo final, una afirmación conocida como convergencia instrumental. Los escépticos contraargumentan que esta cadena de razonamiento se basa en suposiciones no demostradas sobre cómo se desarrollarán realmente la capacidad, la orientación a objetivos y la autonomía en los sistemas reales.

Principales defensores

El filósofo Nick Bostrom sentó las bases académicas con un artículo de 2002 sobre el riesgo existencial y su libro de 2014 sobre la superinteligencia. El investigador Eliezer Yudkowsky, fundador del Instituto de Investigación sobre Inteligencia Artificial (Machine Intelligence Research Institute), ha defendido durante más de una década que la superinteligencia desalineada representa una amenaza grave y subestimada, y ha abogado por controles internacionales estrictos sobre el desarrollo de la IA de frontera. El informático Dan Hendrycks, autor del benchmark de conocimiento MMLU, ha dirigido investigaciones en el Centro para la Seguridad de la IA (Center for AI Safety) orientadas a cuantificar y comunicar los riesgos catastróficos. Los pioneros del aprendizaje profundo Yoshua Bengio y Geoffrey Hinton, este último tras dejar Google en 2023, han declarado públicamente que el avance de la capacidad de la IA aumenta la probabilidad de riesgos graves, incluidos los existenciales.

La declaración de 2023 y la carta de pausa

La preocupación pública se cristalizó en 2023 a través de dos documentos notables. En marzo, la carta de pausa del Instituto del Futuro de la Vida (Future of Life Institute) pedía una moratoria de seis meses en el entrenamiento de sistemas de IA más potentes que GPT-4, y reunió a miles de firmantes, incluidos investigadores y tecnólogos prominentes, aunque varios de ellos no detuvieron realmente sus propios desarrollos. En mayo, el Centro para la Seguridad de la IA publicó una declaración de una sola frase: "Mitigar el riesgo de extinción por la IA debería ser una prioridad global junto a otros riesgos a escala social, como las pandemias y la guerra nuclear", firmada por cientos de investigadores y ejecutivos de IA, incluidos líderes de OpenAI, Google DeepMind y Anthropic.

Escepticismo y contraargumentos

Entre los escépticos destacados se encuentra Yann LeCun, quien ha argumentado que el marco del riesgo existencial es especulativo y prematuro dadas las limitaciones de los sistemas actuales, y Gary Marcus, que ha criticado tanto los supuestos técnicos detrás de los escenarios apocalípticos como los incentivos de los laboratorios que advierten simultáneamente sobre riesgos catastróficos mientras compiten por construir sistemas más potentes. Críticos como Timnit Gebru y Emily Bender han señalado que centrarse en riesgos hipotéticos a largo plazo desvía la atención y los recursos de daños documentados a corto plazo, como los sesgos en los resultados, el desplazamiento laboral y la concentración de poder en un pequeño número de empresas.

Respuesta política

El marco del riesgo existencial y catastrófico ha influido en las políticas gubernamentales, incluida la Declaración de Bletchley de 2023, firmada por 28 países en la Cumbre de Seguridad de la IA, y en cláusulas que abordan el riesgo sistémico de los modelos de propósito general más capaces dentro del Reglamento de Inteligencia Artificial de la Unión Europea. Varios laboratorios de frontera, incluidos Anthropic y OpenAI, han publicado marcos internos de gestión de riesgos, a veces denominados políticas de escalado responsable, que establecen salvaguardas vinculadas a la capacidad de los modelos a medida que cruzan umbrales de riesgo definidos.

Categorías:ai-safety·policy
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial