Voluntad extrapolada coherente

Traducido del inglés

La volición extrapolada coherente (CEV) es un marco teórico de alineación de IA propuesto por Eliezer Yudkowsky en 2004, que describe cómo una superinteligencia artificial podría actuar sobre una versión idealizada y extrapolada de las preferencias humanas en lugar de las actuales.

La volición extrapolada coherente (CEV, por sus siglas en inglés) es un marco teórico en el campo de la alineación de la IA que describe un enfoque mediante el cual una superinteligencia artificial (ASI, por sus siglas en inglés) actuaría bajo una suposición benévola de lo que los humanos podrían desear si fueran más conocedores, más racionales, tuvieran más tiempo para pensar y hubieran madurado juntos como sociedad, en lugar de las preferencias individuales o colectivas actuales de la humanidad. Fue propuesto por Eliezer Yudkowsky en 2004 como parte de su trabajo sobre IA amigable.

El concepto aborda el desafío de especificar objetivos para sistemas de IA avanzados que puedan superar la inteligencia humana. En lugar de codificar un conjunto fijo de reglas o valores, la CEV sugiere que una ASI debería derivar sus objetivos extrapolando la volición de la humanidad, con el fin de reflejar lo que las personas podrían desear bajo condiciones epistémicas y morales ideales.

Concepto

La CEV propone que un sistema de IA avanzado debería derivar sus objetivos extrapolando la volición de la humanidad. Esto significa agregar y proyectar las preferencias humanas en un proceso que refleje lo que las personas podrían desear bajo condiciones epistémicas y morales ideales. El objetivo es garantizar que los sistemas de IA no transgredan los verdaderos intereses de la humanidad; no sigan preferencias transitorias o mal informadas, ni decidan cuestiones sobre las cuales la voluntad humana aún es impredecible.

En términos poéticos, nuestra volición extrapolada coherente es nuestro deseo si supiéramos más, pensáramos más rápido, fuéramos más las personas que deseábamos ser, hubiéramos crecido más juntos; donde la extrapolación converge en lugar de divergir, donde nuestros deseos se cohesionan en lugar de interferir; extrapolada como deseamos que se extrapolara, interpretada como deseamos que se interpretara.

El marco está diseñado para ser humano y autocorrectivo al capturar la fuente de los valores humanos en lugar de intentar enumerarlos. Evita la dificultad de establecer una lista explícita y fija de reglas. Encapsula el crecimiento moral, evitando que las creencias morales actuales defectuosas queden fijadas. Limita la influencia que un pequeño grupo de programadores puede tener sobre lo que la ASI valoraría, reduciendo así también los incentivos para construir la ASI primero. Y mantiene a la humanidad a cargo de su destino.

Debate

Yudkowsky y Nick Bostrom señalan que la CEV tiene varias propiedades interesantes, pero también enfrenta desafíos teóricos y prácticos significativos. Bostrom señala que la CEV tiene "una serie de parámetros libres que podrían especificarse de diversas maneras, dando lugar a diferentes versiones de la propuesta". Uno de esos parámetros es la base de extrapolación (cuya volición extrapolada se toma en cuenta). Por ejemplo, si debería incluir a personas con demencia severa, pacientes en estado vegetativo, fetos o embriones. También señala que si la base de extrapolación de la CEV solo incluye humanos, existe el riesgo de que el resultado sea poco generoso hacia otros animales y mentes digitales. Una posible solución sería incluir un mecanismo para expandir la base de extrapolación de la CEV.

Estos debates son parte del discurso más amplio sobre la alineación de la IA y la seguridad de la IA, que examina cómo garantizar que los sistemas de IA avanzados actúen de acuerdo con los valores e intereses humanos.

Variantes y alternativas

Una alternativa teórica propuesta a la CEV es confiar en las capacidades cognitivas superiores de una superinteligencia artificial para descubrir qué es moralmente correcto y dejar que actúe en consecuencia. También es posible combinar ambas técnicas, por ejemplo, con la ASI siguiendo la CEV excepto cuando sea moralmente impermisible.

En otra revisión, un análisis filosófico explora la CEV a través del lente de la confianza social en sistemas autónomos. Basándose en el concepto de "confianza activa" de Anthony Giddens, el autor propone una evolución de la CEV hacia la "Volición Coherente, Extrapolada y Agrupada" (CECV, por sus siglas en inglés). Esta formulación tiene como objetivo reflejar mejor las preferencias morales de diversos grupos culturales, ofreciendo así un marco ético más pragmático para diseñar sistemas de IA que ganen la confianza pública mientras acomodan la diversidad societal.

Relación con otros conceptos de IA

La CEV se sitúa dentro del campo más amplio de la investigación en inteligencia artificial, particularmente en discusiones sobre cómo diseñar sistemas que sean beneficiosos para la humanidad. Contrasta con enfoques que dependen de sistemas explícitos basados en reglas o del aprendizaje a partir de la retroalimentación humana, como el RLHF (aprendizaje por refuerzo a partir de retroalimentación humana), que se utiliza en los grandes modelos de lenguaje modernos. Mientras que el RLHF busca alinear los modelos con las preferencias humanas actuales mediante retroalimentación iterativa, la CEV propone una extrapolación más ambiciosa de esas preferencias.

El marco también se relaciona con cuestiones sobre racionalidad y toma de decisiones en sistemas de IA. Asume que existe un conjunto coherente de preferencias al que los humanos convergerían bajo condiciones ideales, lo cual es un supuesto filosófico controvertido.

Véase también

Enlaces externos

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:ai-alignment·ai-safety·philosophy-of-ai
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial