Traducido del inglés

Red teaming, aplicado a la IA, es la práctica de sondear deliberadamente un modelo en busca de comportamientos dañinos, inseguros o explotables antes de su despliegue, con el fin de identificar y corregir problemas de antemano.

Red teaming, aplicado a la IA, es la práctica de sondear deliberadamente un modelo o sistema para detectar comportamientos dañinos, inseguros, sesgados o no deseables, típicamente antes de su despliegue público, con el fin de encontrar y resolver problemas con antelación. El término se origina en la práctica militar y de ciberseguridad, donde un red team desempeña el papel de adversario contra un blue team que defiende un sistema; los laboratorios de IA adoptaron este marco para describir las pruebas adversarias sistemáticas de modelos, tanto para riesgos a corto plazo, como salidas tóxicas o sesgadas, como para riesgos más severos, como ayudar a generar información sobre armas, facilitar ciberataques o mostrar comportamientos engañosos.

Red teaming se convirtió en un estándar, y en algunas jurisdicciones legalmente esperado, en el ciclo de desarrollo de IA desde alrededor de 2022 a 2023, a medida que laboratorios como OpenAI y Anthropic publicaron detalles de sus procesos de red teaming y los gobiernos comenzaron a referenciarlo en políticas.

Métodos

Los métodos de red teaming en IA varían desde manuales hasta completamente automatizados. El red teaming manual emplea evaluadores humanos, a veces expertos en áreas como bioseguridad, ciberseguridad o seguridad infantil, que intentan creativamente generar salidas dañinas mediante técnicas que incluyen jailbreaks y inyección de prompts. El red teaming automatizado utiliza otro modelo de IA, o un algoritmo de búsqueda, para generar de manera masiva indicaciones adversarias e identificar cuáles tienen éxito, permitiendo una cobertura mucho mayor de la que podrían lograr solo los evaluadores humanos. El red teaming externo incorpora investigadores independientes o firmas especializadas sin un interés en resultados positivos, con el objetivo de exponer problemas que el equipo interno pudiera pasar por alto o no desee informar.

Práctica en los principales laboratorios

Anthropic, OpenAI y Google DeepMind han publicado metodologías de red teaming y, en algunos casos, resultados, como parte de la documentación de lanzamiento de modelos, a menudo llamados tarjetas de sistemas. El lanzamiento de GPT-4 de OpenAI en 2023 incluyó una sección de red teaming que describía pruebas de capacidades peligrosas, como asistencia con bioweapons y uso indebido en ciberseguridad, realizadas en parte por expertos externos bajo un acceso temprano. Los hoteles de seguridad de IA afiliados a gobiernos, establecidos tras la conferencia de Bletchley Park en 2023, comenzaron a realizar sus propias evaluaciones previas al despliegue de modelos fronterizos por fábricas de laboratorios importantes de forma voluntaria, y se vieron que la medida se personalized, que verificación para riesgos de inseguridad nacional.

Relación con otras prácticas de seguridad

Red teaming se suele entender como un complemento, en lugar de un reemplazo, de otros trabajos de seguridad de IA: detecta problemas una vez que ya están previamente presentes en un modelo cognitivo o e selves sistema, mientras que técnicas como RLHF y IA Constitucional tienen como objetivo optar por modelar el comportamiento durante el entrenamiento, y los guardarraíles añaden defensas en tiempo de ejecución propietario. Los hallazgos de las ejercicios red teaming suelen retroalimentar en entradas adicionales, más barreras de protección o, en algunos casos documentados, decisiones de retrasar o restringir la publicación del modelo. Los críticos han señalado que la cobertura del red teaming es necesariamente incompleta, puesto que los evaluadores no pueden anticipar todos los usos indebidos posibles, y que la utilidad de la práctica depende en gran medida de cómo se actúe realmente sobre hallazgos, así que un mero documentar para fines de cumplimiento.

Categorías:ai-safety·evaluation
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial