La interpretabilidad mecanicista es un programa de investigación dentro de la seguridad de la IA y el aprendizaje automático que intenta realizar ingeniería inversa de los pesos entrenados de una red neuronal para obtener una explicación comprensible para los humanos de los algoritmos que implementa, en lugar de simplemente aproximar su comportamiento desde fuera, como hacen la mayoría de los métodos de IA explicable. El enfoque trata a un modelo entrenado de manera similar a como un ingeniero inverso podría tratar un código binario compilado sin su fuente: al sondear neuronas individuales, capas y combinaciones de pesos, los investigadores intentan recuperar las características y circuitos discretos que una red utiliza para realizar una tarea, con el objetivo final de poder predecir, verificar o editar el comportamiento de un modelo con la misma confianza que al leer su código fuente.
Orígenes
Los primeros trabajos de interpretabilidad en visión por computadora, incluida la investigación sobre visualización de características asociada con la revista en línea Distill, mostraron que neuronas individuales o pequeños grupos de neuronas en clasificadores de imágenes, como los modelos de red neuronal convolucional, podían corresponder a conceptos reconocibles como curvas, texturas o partes de objetos. Chris Olah, cofundador de Anthropic y figura destacada en el campo, ayudó a popularizar este estilo de análisis visual basado en circuitos antes de extenderlo a los modelos de lenguaje. El auge de la arquitectura transformador y de los sistemas de modelos de lenguaje grandes desplazó el enfoque del campo hacia la comprensión de los cabezales de atención, los flujos residuales y las representaciones internas que permiten a un modelo realizar tareas como el aprendizaje en contexto.
Hallazgos clave
Los investigadores de interpretabilidad han identificado varios fenómenos recurrentes. La superposición describe el hallazgo de que las redes neuronales a menudo representan más características distintas de las neuronas que poseen, empaquetando múltiples conceptos en direcciones superpuestas en el espacio de activación, lo que dificulta interpretar neuronas individuales de forma aislada. Los autoencoders dispersos, una aplicación de la técnica más amplia de autoencoder, se han utilizado para descomponer estas representaciones superpuestas en un conjunto mucho más grande de características más monosemánticas e interpretables individualmente; el trabajo de Anthropic en 2024 que identificó millones de tales características en un modelo Claude a escala de producción, y el trabajo posterior que localizó y editó características específicas relevantes para el comportamiento, se contó entre los resultados más discutidos del campo. Otras líneas de trabajo han identificado circuitos específicos responsables de capacidades limitadas, como un mecanismo de "cabeza de inducción" que permite a los modelos transformadores completar patrones repetidos, y han utilizado herramientas de interpretabilidad para detectar signos de engaño o mala generalización de objetivos dentro de un modelo, en lugar de depender únicamente de su salida declarada.
Motivación y lo que está en juego
Los defensores argumentan que la interpretabilidad mecanicista es una de las pocas direcciones de investigación que podría dar a los humanos una visión genuina de si un modelo altamente capaz está persiguiendo los objetivos que parece perseguir, en lugar de depender solo de pruebas de comportamiento, una preocupación estrechamente vinculada a los debates sobre alineación y hacking de recompensas. Debido a que la interpretabilidad apunta a abrir la caja negra directamente en lugar de explicarla después del hecho, algunos investigadores la consideran un requisito previo para implementar con confianza sistemas futuros mucho más capaces, incluidos aquellos que se acerquen a la inteligencia artificial general.
Limitaciones
El campo sigue lejos de una explicación completa de cualquier modelo de frontera; las técnicas actuales escalan mal al tamaño de los modelos de producción, las características de los autoencoders dispersos no cubren de manera limpia todo el comportamiento de una red, y no existe un método acordado para verificar que una explicación basada en interpretabilidad sea completa en lugar de meramente plausible. Los investigadores generalmente describen la interpretabilidad mecanicista como una ciencia en etapa temprana, comparable en ambición, aunque no aún en madurez, al intento de la neurociencia de mapear cerebros biológicos.