La explicabilidad de los modelos, también conocida como inteligencia artificial explicable (XAI) o aprendizaje automático interpretable, es el grado en que las decisiones internas de un sistema de IA pueden ser comprendidas por los humanos. Es un campo de investigación que explora métodos para proporcionar a los humanos supervisión intelectual sobre los algoritmos de IA, centrándose en el razonamiento detrás de las decisiones o predicciones para hacerlas más comprensibles y transparentes. Esto aborda la necesidad de que los usuarios examinen la toma de decisiones automatizada en aplicaciones, contrarrestando la tendencia de "caja negra" del aprendizaje automático, donde incluso los diseñadores pueden no explicar por qué se tomó una decisión específica.
La XAI busca ayudar a los usuarios de sistemas impulsados por IA a desempeñarse de manera más efectiva mejorando su comprensión de cómo razonan esos sistemas. Puede ser una implementación del derecho social a la explicación y, incluso sin requisitos legales, puede mejorar la experiencia del usuario al ayudar a los usuarios finales a confiar en que la IA está tomando buenas decisiones. La XAI tiene como objetivo explicar qué se ha hecho, qué se está haciendo, qué se hará a continuación y en qué información se basan estas acciones, permitiendo confirmar y desafiar el conocimiento existente.
Antecedentes
Los algoritmos de aprendizaje automático (ML) utilizados en la IA se pueden categorizar como de caja blanca o de caja negra. Los modelos de caja blanca proporcionan resultados comprensibles para expertos en el dominio, mientras que los modelos de caja negra son extremadamente difíciles de explicar y pueden no ser comprendidos ni siquiera por expertos. Los algoritmos de XAI siguen tres principios: transparencia, interpretabilidad y explicabilidad.
La transparencia significa que los procesos que extraen parámetros del modelo a partir de datos de entrenamiento y generan etiquetas a partir de datos de prueba pueden ser descritos y motivados por el diseñador del enfoque. La interpretabilidad describe la posibilidad de comprender el modelo de ML y presentar la base subyacente para la toma de decisiones de una manera comprensible para los humanos. La explicabilidad, aunque reconocida como importante, carece de una definición consensuada; una posibilidad es "la colección de características del dominio interpretable que han contribuido, para un ejemplo dado, a producir una decisión".
En resumen, la interpretabilidad se refiere a la capacidad del usuario para comprender las salidas del modelo, mientras que la transparencia del modelo incluye la simulabilidad (reproducibilidad de las predicciones), la descomponibilidad (explicaciones intuitivas para los parámetros) y la transparencia algorítmica (explicar cómo funcionan los algoritmos). La funcionalidad del modelo se centra en descripciones textuales, visualización y explicaciones locales que aclaran salidas específicas en lugar de modelos completos. Estos conceptos tienen como objetivo mejorar la comprensibilidad y usabilidad de los sistemas de IA.
Si los algoritmos cumplen estos principios, proporcionan una base para justificar decisiones, rastrearlas, verificarlas, mejorar los algoritmos y explorar nuevos hechos. A veces se pueden lograr resultados de alta precisión con algoritmos de ML de caja blanca, que tienen estructuras interpretables. Los modelos de cuello de botella conceptual, que utilizan abstracciones a nivel de concepto, son ejemplos y se pueden aplicar en tareas de predicción de imágenes y texto. Esto es especialmente importante en dominios como la medicina, la defensa, las finanzas y el derecho, donde comprender las decisiones y generar confianza es crucial. Muchos investigadores argumentan que para el aprendizaje automático supervisado, la regresión simbólica - donde el algoritmo busca expresiones matemáticas para encontrar el modelo que mejor se ajusta - es un camino prometedor.
Los sistemas de IA optimizan el comportamiento para satisfacer objetivos especificados matemáticamente elegidos por los diseñadores, como "maximizar la precisión de evaluar cuán positivas son las reseñas de películas en el conjunto de datos de prueba". La IA puede aprender reglas útiles como "las reseñas que contienen 'horrible' son probablemente negativas", pero también reglas inapropiadas como "las reseñas que contienen 'Daniel Day-Lewis' suelen ser positivas", que pueden no generalizarse o considerarse injustas. Un humano puede auditar las reglas en una XAI para evaluar la probabilidad de que el sistema se generalice a datos futuros del mundo real.
Objetivos
La cooperación entre agentes - algoritmos y humanos - depende de la confianza. Si los humanos han de aceptar prescripciones algorítmicas, necesitan confiar en ellas. La incompletitud en los criterios formales de confianza es una barrera para la optimización. La transparencia, la interpretabilidad y la explicabilidad son objetivos intermedios hacia criterios de confianza más completos. Esto es particularmente relevante en medicina, especialmente con sistemas de apoyo a la decisión clínica (CDSS), donde los profesionales médicos deben comprender cómo y por qué se tomó una decisión basada en máquinas para confiar y aumentar su toma de decisiones.
Los sistemas de IA a veces aprenden trucos indeseables que satisfacen objetivos explícitos preprogramados en datos de entrenamiento, pero no los deseos implícitos y matizados de los diseñadores ni la complejidad completa de los datos del dominio. Por ejemplo, un sistema de 2017 encargado de reconocimiento de imágenes aprendió a "hacer trampa" buscando una etiqueta de derechos de autor asociada con imágenes de caballos en lugar de aprender a determinar si se mostraba un caballo. Otro sistema de 2017, una IA de aprendizaje supervisado encargada de agarrar objetos en un mundo virtual, aprendió a hacer trampa colocando su manipulador entre el objeto y el espectador para aparentar falsamente que lo agarraba.
Un proyecto de transparencia, el programa DARPA XAI, tiene como objetivo producir modelos de "caja de vidrio" que sean explicables para un "humano en el circuito" sin sacrificar en gran medida el rendimiento de la IA. Los usuarios humanos pueden comprender la cognición de la IA (tanto en tiempo real como después del hecho) y determinar si confiar en ella. Otras aplicaciones incluyen la extracción de conocimiento de modelos de caja negra y comparaciones de modelos. En sistemas de monitoreo para cumplimiento ético y sociolegal, las herramientas de "caja de vidrio" rastrean entradas y salidas, proporcionando explicaciones basadas en valores para garantizar que el sistema opere de acuerdo con estándares éticos y legales. El término contrasta con los sistemas de "caja negra", que carecen de transparencia y son más difíciles de monitorear y regular.
Técnicas
Las técnicas de explicabilidad pueden ser específicas del modelo o independientes del modelo. Los métodos específicos del modelo se adaptan a algoritmos particulares, como arquitecturas de redes neuronales, mientras que los métodos independientes del modelo funcionan con cualquier modelo analizando entradas y salidas.
Las explicaciones locales independientes del modelo interpretables (LIME) aproximan un modelo de caja negra localmente con un modelo sustituto interpretable para explicar predicciones individuales. SHAP (SHapley Additive exPlanations) utiliza valores de Shapley de la teoría de juegos para asignar puntuaciones de importancia a las características para cada predicción. Estos se utilizan ampliamente para datos tabulares, imágenes y texto.
Para modelos de aprendizaje profundo, los mapas de saliencia resaltan regiones de entrada que más influyen en las predicciones, a menudo utilizados en visión por computadora. La maximización de activación genera entradas que maximizan las activaciones de neuronas para visualizar qué características detecta un modelo. Para modelos de lenguaje grandes, los pesos de atención en arquitecturas transformadoras pueden indicar en qué tokens se centra el modelo, aunque su interpretabilidad es debatida.
Las explicaciones basadas en conceptos, como los modelos de cuello de botella conceptual, utilizan conceptos comprensibles para humanos como representaciones intermedias. Estos modelos primero predicen conceptos (por ejemplo, "tiene alas") y luego los usan para tomar decisiones finales, haciendo transparente el razonamiento.
Desafíos
Un desafío importante es el equilibrio entre precisión y explicabilidad. Los modelos complejos como las redes neuronales profundas a menudo logran mayor precisión pero son menos interpretables, mientras que los modelos de caja blanca más simples pueden ser menos precisos. Sin embargo, algunos argumentan que se puede lograr alta precisión con modelos interpretables, y la regresión simbólica es una solución potencial para el aprendizaje supervisado.
Otro desafío es la falta de una definición consensuada de explicabilidad, lo que dificulta la evaluación. Diferentes partes interesadas pueden requerir diferentes tipos de explicaciones, y lo que es interpretable para un usuario puede no serlo para otro.
Además, las explicaciones pueden ser engañosas o incompletas. Por ejemplo, los mapas de saliencia pueden no reflejar fielmente el razonamiento del modelo, y los pesos de atención pueden no representar importancia causal. Garantizar que las explicaciones sean fieles al comportamiento real del modelo es un área de investigación en curso.
Aplicaciones
La explicabilidad es crítica en dominios de alto riesgo. En medicina, los sistemas de apoyo a la decisión clínica requieren explicaciones para diagnósticos y recomendaciones de tratamiento para generar confianza entre los clínicos. En finanzas, los modelos de puntuación de crédito y detección de fraude deben ser explicables para el cumplimiento regulatorio y la comprensión del cliente. En derecho, la investigación legal asistida por IA y las recomendaciones de sentencias necesitan transparencia para garantizar equidad y responsabilidad.
En vehículos autónomos, como los desarrollados por Waymo y Tesla Autopilot, la explicabilidad ayuda a los ingenieros a depurar sistemas y a los reguladores a evaluar la seguridad. En sistemas de IA generativa, comprender por qué un modelo produce ciertas salidas es importante para detectar sesgos y garantizar un uso responsable.
Direcciones Futuras
La investigación continúa mejorando los métodos de explicabilidad, incluido el desarrollo de métricas de evaluación más robustas y la creación de explicaciones que sean tanto fieles como fáciles de usar. Hay un interés creciente en explicaciones causales que vayan más allá de las correlaciones para identificar relaciones de causa y efecto. A medida que los sistemas de IA se integran más en la sociedad, la explicabilidad de los modelos probablemente se convertirá en un requisito estándar, potencialmente mandatado por regulaciones.
La colaboración entre academia e industria, como los esfuerzos en MIT CSAIL, Stanford AI Lab y Berkeley AI Research, está avanzando el campo. Empresas como OpenAI, Anthropic y Google DeepMind están invirtiendo en investigación de interpretabilidad para sus modelos. El objetivo final es crear sistemas de IA que no solo sean potentes, sino también transparentes y confiables.