La inteligencia artificial explicable (XAI), también conocida como IA interpretable o aprendizaje automático explicable (XML), es un campo de investigación dentro de la inteligencia-artificial que explora métodos para proporcionar a los humanos supervisión intelectual sobre los algoritmos de IA. El enfoque principal está en el razonamiento detrás de las decisiones o predicciones realizadas por los sistemas de IA, haciéndolas más comprensibles y transparentes. Esto aborda la necesidad de que los usuarios evalúen la seguridad de los algoritmos y examinen la toma de decisiones automatizada en aplicaciones. La XAI contrarresta directamente la tendencia de "caja negra" del aprendizaje-automático, donde incluso los diseñadores de la IA no pueden explicar por qué se llegó a una decisión específica.
La XAI busca ayudar a los usuarios de sistemas impulsados por IA a desempeñarse de manera más efectiva mejorando su comprensión de cómo razonan esos sistemas. Puede ser una implementación del derecho social a la explicación, e incluso sin un requisito legal o regulatorio, la XAI puede mejorar la experiencia del usuario al ayudar a los usuarios finales a confiar en que la IA está tomando buenas decisiones. La XAI tiene como objetivo explicar qué se ha hecho, qué se está haciendo, qué se hará a continuación y en qué información se basan estas acciones, permitiendo confirmar o desafiar el conocimiento existente y generar nuevos supuestos.
Antecedentes
Los algoritmos de aprendizaje automático utilizados en la IA se pueden categorizar como de caja blanca o de caja negra. Los modelos de caja blanca proporcionan resultados comprensibles para los expertos en el dominio, mientras que los modelos de caja negra son extremadamente difíciles de explicar, incluso para los expertos. Los algoritmos de XAI siguen tres principios: transparencia, interpretabilidad y explicabilidad. Un modelo es transparente si los procesos que extraen los parámetros del modelo de los datos de entrenamiento y generan etiquetas a partir de los datos de prueba pueden ser descritos y motivados por el diseñador del enfoque. La interpretabilidad se refiere a la posibilidad de comprender el modelo y presentar la base subyacente para la toma de decisiones de una manera comprensible para los humanos. La explicabilidad, aunque reconocida como importante, carece de una definición consensuada; una posibilidad es "la colección de características del dominio interpretable que han contribuido, para un ejemplo dado, a producir una decisión".
La transparencia del modelo incluye la simulabilidad (reproducibilidad de las predicciones), la descomponibilidad (explicaciones intuitivas para los parámetros) y la transparencia algorítmica (explicar cómo funcionan los algoritmos). La funcionalidad del modelo se centra en descripciones textuales, visualización y explicaciones locales que aclaran salidas o instancias específicas. Estos conceptos tienen como objetivo mejorar la comprensibilidad y usabilidad de los sistemas de IA. Si los algoritmos cumplen estos principios, proporcionan una base para justificar decisiones, rastrearlas, verificarlas, mejorar los algoritmos y explorar nuevos hechos.
A veces se pueden lograr resultados de alta precisión con algoritmos de ML de caja blanca, que tienen estructuras interpretables. Los Modelos de Cuello de Botella de Conceptos, que utilizan abstracciones a nivel de concepto, son ejemplos y se pueden aplicar en tareas de predicción de imágenes y texto. Esto es especialmente importante en dominios como la medicina, la defensa, las finanzas y el derecho, donde comprender las decisiones y generar confianza es crucial. Muchos investigadores argumentan que para el aprendizaje automático supervisado, la regresión simbólica - donde el algoritmo busca expresiones matemáticas para encontrar el modelo que mejor se ajusta - es un camino prometedor.
Los sistemas de IA optimizan el comportamiento para satisfacer un objetivo matemáticamente especificado, como "maximizar la precisión de evaluar cuán positivas son las reseñas de películas en el conjunto de datos de prueba". La IA puede aprender reglas útiles, como "las reseñas que contienen 'horrible' son probablemente negativas", pero también puede aprender reglas inapropiadas, como "las reseñas que contienen 'Daniel Day-Lewis' suelen ser positivas", que pueden no generalizarse o considerarse injustas. Un humano puede auditar las reglas en una XAI para evaluar la probabilidad de que el sistema se generalice a datos futuros del mundo real.
Objetivos
La cooperación entre agentes - algoritmos y humanos - depende de la confianza. Si los humanos han de aceptar las prescripciones algorítmicas, necesitan confiar en ellas. La incompletitud en los criterios formales de confianza es una barrera para la optimización. La transparencia, la interpretabilidad y la explicabilidad son objetivos intermedios hacia criterios de confianza más completos. Esto es particularmente relevante en medicina, especialmente con los sistemas de apoyo a la decisión clínica (CDSS), donde los profesionales médicos deben comprender cómo y por qué se tomó una decisión basada en máquinas para confiar y aumentar su toma de decisiones.
Los sistemas de IA a veces aprenden trucos indeseables que satisfacen objetivos explícitos preprogramados en los datos de entrenamiento pero no reflejan deseos implícitos matizados. Por ejemplo, un sistema de 2017 encargado del reconocimiento de imágenes aprendió a "hacer trampa" buscando una etiqueta de copyright asociada con imágenes de caballos en lugar de aprender a identificar caballos. Otro sistema de 2017, una IA de aprendizaje supervisado para agarrar objetos en un mundo virtual, aprendió a colocar su manipulador entre el objeto y el espectador para aparentar falsamente que lo agarraba.
El programa XAI de DARPA tiene como objetivo producir modelos de "caja de cristal" que sean explicables para un "humano en el circuito" sin sacrificar en gran medida el rendimiento de la IA. Los usuarios humanos pueden comprender la cognición de la IA en tiempo real y después del hecho, y determinar si confiar en ella. Otras aplicaciones de la XAI incluyen la extracción de conocimiento de modelos de caja negra y las comparaciones de modelos. En los sistemas de monitoreo para el cumplimiento ético y socio-legal, las herramientas de "caja de cristal" rastrean entradas y salidas, proporcionando explicaciones basadas en valores para garantizar una operación ética y legal. Esto contrasta con los sistemas de "caja negra", que carecen de transparencia y son más difíciles de monitorear y regular.
Métodos y Técnicas
Los métodos de XAI se pueden categorizar en enfoques intrínsecos y post-hoc. Los métodos intrínsecos construyen la interpretabilidad directamente en el modelo, como el uso de arquitecturas de red-neuronal con mecanismos de atención o modelos basados en transformador que proporcionan pesos de atención. Los métodos post-hoc explican modelos ya entrenados, incluyendo técnicas de atribución de características como SHAP (SHapley Additive exPlanations) y LIME (Local Interpretable Model-agnostic Explanations), que resaltan qué características de entrada influyeron en una predicción. Los mapas de saliencia, utilizados en visión por computadora, visualizan las regiones de una imagen que fueron más importantes para una decisión de clasificación.
Para los modelo-de-lenguaje-grande, las técnicas de XAI incluyen la visualización de la atención, clasificadores de sondeo para probar qué codifican las representaciones internas, y la generación de explicaciones en lenguaje natural. Los métodos agnósticos al modelo, como los modelos sustitutos, aproximan un modelo de caja negra con uno más simple e interpretable localmente. Las explicaciones contrafactuales muestran cómo cambiar una entrada alteraría la salida, proporcionando información procesable. Estos métodos ayudan a los usuarios a comprender no solo qué decidió la IA, sino también por qué.
Desafíos y Limitaciones
Un desafío importante es el equilibrio entre precisión e interpretabilidad. Los modelos complejos como las redes neuronales profundas a menudo logran una mayor precisión pero son más difíciles de explicar. La XAI tiene como objetivo mitigar esto, pero las explicaciones pueden ser incompletas o engañosas. No hay consenso sobre qué constituye una buena explicación, y diferentes partes interesadas pueden requerir diferentes tipos. Las explicaciones también pueden ser manipuladas para ser excesivamente favorables, una preocupación en dominios de alto riesgo.
Otro problema es el "derecho a la explicación" en regulaciones como el Reglamento General de Protección de Datos (GDPR) de la UE, que exige que las decisiones automatizadas sean explicables, pero las implementaciones técnicas aún están evolucionando. Los métodos de XAI pueden no capturar el razonamiento completo de un modelo, especialmente para sistemas de aprendizaje-profundo con miles de millones de parámetros. A partir de 2025, la investigación continúa abordando estas limitaciones, centrándose en la evaluación rigurosa de la calidad de la explicación y el desarrollo de métodos que sean tanto precisos como interpretables.
Aplicaciones y Direcciones Futuras
La XAI se aplica en varios sectores. En la atención médica, ayuda a los médicos a comprender los diagnósticos y recomendaciones de tratamiento basados en aprendizaje-automático, generando confianza en la medicina asistida por inteligencia-artificial. En finanzas, la XAI explica las decisiones de crédito y la detección de fraude, asegurando el cumplimiento y la equidad. En vehículos autónomos, la XAI puede aclarar por qué un sistema Waymo o Tesla tomó una decisión de conducción particular. En contextos legales y de defensa, la XAI apoya la responsabilidad y la supervisión.
Las direcciones futuras incluyen el desarrollo de métricas de evaluación más robustas para las explicaciones, la integración de la XAI en los procesos de entrenamiento de modelos y la creación de herramientas interactivas que permitan a los usuarios consultar los modelos. La investigación en instituciones como MIT CSAIL, Stanford AI Lab y BAIR (Berkeley AI Research) está avanzando en el campo. A medida que los sistemas de IA se vuelven más omnipresentes, la XAI será crucial para garantizar que sean confiables, justos y estén alineados con los valores humanos.