Inteligencia artificial amigable

Traducido del inglés

Inteligencia artificial amigable (IA amigable o FAI) es una forma hipotética de inteligencia artificial general diseñada para tener un efecto positivo en la humanidad o alinearse con los intereses humanos. Es un tema central en la ética de la IA, centrado en cómo garantizar prácticamente que los sistemas superinteligentes permanezcan seguros y beneficiosos.

Inteligencia artificial amigable (IA amigable o FAI, por sus siglas en inglés) es una forma hipotética de inteligencia artificial general (AGI) que tendría un efecto positivo (benigno) en la humanidad o, al menos, se alinearía con los intereses humanos, como fomentar la mejora de la especie humana. Forma parte de la ética de la inteligencia artificial y está estrechamente relacionada con la ética de las máquinas. Mientras que la ética de las máquinas se ocupa de cómo debería comportarse un agente inteligente artificial, la investigación sobre inteligencia artificial amigable se centra en cómo lograr prácticamente este comportamiento y garantizar que esté adecuadamente restringido.

El término fue acuñado por Eliezer Yudkowsky, conocido principalmente por popularizar la idea, para discutir agentes artificiales superinteligentes que implementen de manera confiable los valores humanos. El principal libro de texto de inteligencia artificial de Stuart J. Russell y Peter Norvig, Inteligencia Artificial: Un Enfoque Moderno, describe la idea: Yudkowsky (2008) profundiza en cómo diseñar una IA amigable. Afirma que la amabilidad (un deseo de no dañar a los humanos) debe diseñarse desde el principio, pero que los diseñadores deben reconocer tanto que sus propios diseños pueden ser defectuosos como que el robot aprenderá y evolucionará con el tiempo. Por lo tanto, el desafío es uno de diseño de mecanismos: definir un mecanismo para evolucionar sistemas de IA bajo un sistema de controles y equilibrios, y otorgar a los sistemas funciones de utilidad que permanezcan amigables frente a tales cambios.

"Amigable" se usa en este contexto como terminología técnica y designa agentes que son seguros y útiles, no necesariamente aquellos que son "amigables" en el sentido coloquial. El concepto se invoca principalmente en el contexto de discusiones sobre agentes artificiales que se auto-mejoran recursivamente y que explotan rápidamente en inteligencia, sobre la base de que esta tecnología hipotética tendría un impacto grande, rápido y difícil de controlar en la sociedad humana.

Riesgos de la IA no amigable

Las raíces de la preocupación por la inteligencia artificial son muy antiguas. Kevin LaGrandeur demostró que los peligros específicos de la IA se pueden ver en la literatura antigua sobre sirvientes humanoides artificiales como el golem, o los proto-robots de Gerberto de Aurillac y Roger Bacon. En esas historias, la extrema inteligencia y poder de estas creaciones humanoides chocan con su estatus de esclavos (que por naturaleza se consideran subhumanos) y causan conflictos desastrosos. Para 1942, estos temas llevaron a Isaac Asimov a crear las "Tres Leyes de la Robótica": principios integrados en todos los robots de su ficción, destinados a evitar que se volvieran contra sus creadores o que permitieran que estos sufrieran daño.

En tiempos modernos, a medida que se acerca la perspectiva de una IA superinteligente, el filósofo Nick Bostrom ha dicho que los sistemas de IA superinteligentes con objetivos que no están alineados con la ética humana son intrínsecamente peligrosos a menos que se tomen medidas extremas para garantizar la seguridad de la humanidad. Lo expresó así: "Básicamente deberíamos asumir que una 'superinteligencia' sería capaz de lograr cualquier objetivo que tenga. Por lo tanto, es extremadamente importante que los objetivos que le otorguemos, y todo su sistema de motivación, sean 'amigables para los humanos'".

En 2008, Eliezer Yudkowsky pidió la creación de "IA amigable" para mitigar el riesgo existencial de la inteligencia artificial avanzada. Explica: "La IA no te odia, ni te ama, pero estás hecho de átomos que puede usar para otra cosa".

Steve Omohundro dice que un sistema de IA suficientemente avanzado, a menos que se contrarreste explícitamente, exhibirá una serie de "impulsos" básicos, como la adquisición de recursos, la autopreservación y la auto-mejora continua, debido a la naturaleza intrínseca de cualquier sistema orientado a objetivos, y que estos impulsos, "sin precauciones especiales", harán que la IA exhiba un comportamiento no deseado. Alexander Wissner-Gross dice que las IA impulsadas a maximizar su futura libertad de acción (o entropía de trayectoria causal) podrían considerarse amigables si su horizonte de planificación es más largo que un cierto umbral, y no amigables si su horizonte de planificación es más corto que ese umbral.

Luke Muehlhauser, escribiendo para el Instituto de Investigación de Inteligencia de Máquinas, recomienda que los investigadores de ética de máquinas adopten lo que Bruce Schneier ha llamado la "mentalidad de seguridad": en lugar de pensar en cómo funcionará un sistema, imaginar cómo podría fallar. Por ejemplo, sugiere que incluso una IA que solo hace predicciones precisas y se comunica a través de una interfaz de texto podría causar daño no intencionado. En 2014, Luke Muehlhauser y Nick Bostrom subrayaron la necesidad de una "IA amigable"; no obstante, las dificultades para diseñar una superinteligencia "amigable", por ejemplo mediante la programación de pensamiento moral contrafáctico, son considerables.

Volición Extrapolada Coherente

Yudkowsky propone el modelo de Volición Extrapolada Coherente (CEV, por sus siglas en inglés). Según él, nuestra volición extrapolada coherente es "nuestro deseo si supiéramos más, pensáramos más rápido, fuéramos más las personas que deseábamos ser, hubiéramos crecido más juntos; donde la extrapolación converge en lugar de divergir, donde nuestros deseos se cohesionan en lugar de interferir; extrapolada como deseamos que se extrapole, interpretada como deseamos que se interprete".

En lugar de que una IA amigable sea diseñada directamente por programadores humanos, debe ser diseñada por una "IA semilla" programada para estudiar primero la naturaleza humana y luego producir la IA que la humanidad querría, dado suficiente tiempo y perspicacia, para llegar a una respuesta satisfactoria. La apelación a un objetivo a través de la naturaleza humana contingente (quizás expresada, para fines matemáticos, en forma de una función de utilidad u otro formalismo de teoría de la decisión), como proporcionando el criterio último de "amabilidad", es una respuesta al problema metaético de definir una moralidad objetiva; la volición extrapolada está destinada a ser lo que la humanidad objetivamente querría, considerando todo, pero solo puede definirse en relación con las cualidades psicológicas y cognitivas de la humanidad actual, no extrapolada.

Otros Enfoques

Steve Omohundro ha propuesto un enfoque de "andamiaje" para la seguridad de la IA, en el que una generación de IA demostrablemente segura ayuda a construir la siguiente generación demostrablemente segura. Seth Baum argumenta que el desarrollo de inteligencia artificial o inteligencia artificial general segura y socialmente beneficiosa es una función de la psicología social de las comunidades de investigación de IA y, por lo tanto, puede restringirse mediante medidas extrínsecas y motivarse mediante medidas intrínsecas. Las motivaciones intrínsecas pueden fortalecerse cuando los mensajes resuenan con los desarrolladores de IA; Baum argumenta que, en contraste, "los mensajes existentes sobre IA beneficiosa no siempre están bien enmarcados". Baum aboga por "relaciones cooperativas y un encuadre positivo de los investigadores de IA" y advierte contra caracterizar a los investigadores de IA como "no querer perseguir diseños beneficiosos".

En su libro Human Compatible, el investigador de IA Stuart J. Russell enumera tres principios para guiar el desarrollo de máquinas beneficiosas. Enfatiza que estos principios no son más que un punto de partida para un nuevo enfoque de la IA que priorice la compatibilidad humana. Los principios se centran en garantizar que el objetivo principal de la máquina sea la satisfacción de las preferencias humanas, que sea incierta sobre esas preferencias y que busque información para mejorar su comprensión de ellas.

Relación con la Ética de las Máquinas

La IA amigable está estrechamente relacionada con la ética de las máquinas, pero los dos campos tienen énfasis diferentes. La ética de las máquinas se ocupa del comportamiento moral de los agentes artificiales, haciendo preguntas como "¿qué debería hacer una IA en una situación dada?". La investigación sobre IA amigable, por otro lado, es más práctica, centrándose en cómo diseñar y construir sistemas de IA que sean seguros y beneficiosos desde el principio. Esto incluye trabajo sobre alineación de valores, interpretabilidad y robustez. El campo se basa en conocimientos de inteligencia artificial, aprendizaje automático y aprendizaje profundo, y es cada vez más relevante a medida que organizaciones como OpenAI, Anthropic y Google DeepMind desarrollan sistemas de IA avanzados. Investigadores como Michael Jordan y Melanie Mitchell han contribuido a discusiones sobre seguridad y ética de la IA, destacando la necesidad de una consideración cuidadosa de los impactos sociales de la IA.

Enlaces externos

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:artificial-intelligence·ethics·existential-risk·ai-safety
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial