Traducido del inglés

Paul Christiano es un investigador estadounidense de seguridad de la IA que codesarrolló la técnica que se convirtió en el aprendizaje por refuerzo a partir de la retroalimentación humana y, más tarde, fundó el Centro de Investigación de Alineación.

Paul Christiano es un investigador estadounidense en alineación de IA conocido por co-desarrollar la técnica que se convirtió en RLHF y por fundar el Alignment Research Center, una organización sin fines de lucro dedicada a la investigación de la alineación.

Carrera temprana y RLHF

Christiano trabajó como investigador en OpenAI en sus primeros años, donde en 2017 fue coautor de "Deep Reinforcement Learning from Human Preferences", un artículo que introdujo el método central de entrenar un modelo de recompensa a partir de comparaciones humanas entre salidas del modelo y luego optimizar una política contra ese modelo de recompensa. Este enfoque, posteriormente ampliado y aplicado a modelos de lenguaje como RLHF, se convirtió en la técnica dominante para alinear modelos orientados al chat con la intención humana, siendo más visible en el entrenamiento detrás de ChatGPT y su predecesor de seguimiento de instrucciones, InstructGPT.

Alignment Research Center

En 2021, Christiano dejó OpenAI para fundar el Alignment Research Center (ARC), una organización sin fines de lucro centrada en el trabajo teórico en alineación de IA, incluyendo investigación sobre "extraer conocimiento latente" de los modelos y métodos para evaluar si un modelo tiene capacidades o intenciones que sus salidas no revelan. ARC también se hizo conocido por construir y ejecutar algunas de las primeras evaluaciones formales de capacidades previas al despliegue de modelos frontera, incluyendo pruebas de capacidades peligrosas realizadas en coordinación con laboratorios como OpenAI y Anthropic antes de lanzamientos como GPT-4.

Instituto de Seguridad de IA de EE. UU.

En 2024, Christiano fue designado para liderar el trabajo de evaluación centrado en la seguridad en el Instituto de Seguridad de IA de EE. UU., ubicado dentro del Instituto Nacional de Estándares y Tecnología, un rol que colocó a un investigador estrechamente asociado con el trabajo técnico de alineación dentro de un organismo gubernamental responsable de evaluar modelos frontera antes del proceso de cumbre internacional de seguridad de IA que comenzó en Bletchley Park en noviembre de 2023. El nombramiento generó tanto apoyo como críticas de diferentes partes de la comunidad de seguridad de IA por cuestiones de independencia y la capacidad de evaluación del gobierno.

Influencia

Christiano es ampliamente considerado dentro del campo de seguridad de IA como uno de los investigadores más responsables de traducir las preocupaciones abstractas sobre riesgo existencial a largo plazo de la IA en programas de investigación concretos y empíricamente comprobables, uniendo el trabajo más filosófico asociado con figuras como Nick Bostrom y las técnicas de entrenamiento aplicadas utilizadas en casi todos los modelos principales orientados al chat lanzados después de 2022.

Categorías:ai-safety·alignment·industry
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial