Traducido del inglés

Ethan Perez es un investigador en Anthropic especializado en evaluación y seguridad de la IA, conocido por su trabajo sobre el comportamiento de los modelos de lenguaje grandes y la supervisión escalable. Ha contribuido a importantes puntos de referencia de seguridad de la IA y a la investigación sobre alineación.

Ethan Perez es un investigador en Anthropic especializado en la evaluación y seguridad de la IA. Su trabajo se centra en comprender y mejorar el comportamiento de los modelos de lenguaje grandes, particularmente en áreas como la veracidad, el sesgo y la supervisión escalable. Ha contribuido a varios conjuntos de referencia y estudios influyentes en el campo de la alineación de la IA.

La investigación de Perez se sitúa en la intersección del aprendizaje automático y la seguridad de la IA, abordando los desafíos que surgen a medida que los modelos se vuelven más capaces. Es conocido por sus esfuerzos para desarrollar métodos de evaluación que puedan mantenerse al ritmo de los rápidos avances en IA generativa.

Primeros años y educación

Perez completó sus estudios de grado en ciencias de la computación, donde se interesó por primera vez en la inteligencia artificial y sus implicaciones sociales. Posteriormente, realizó investigaciones de posgrado centradas en el procesamiento del lenguaje natural y la evaluación de modelos. Durante su período académico, colaboró con investigadores de instituciones como Stanford AI Lab y Berkeley AI Research.

Su trabajo inicial implicó analizar cómo los modelos grandes se desempeñan en tareas que requieren razonamiento y precisión factual. Esto sentó las bases para sus contribuciones posteriores a la seguridad de la IA.

Contribuciones a la evaluación de la IA

En Anthropic, Perez ha sido fundamental en el diseño de conjuntos de evaluación que examinan las capacidades y limitaciones de los modelos. Coautor de investigaciones sobre la medición de la adulación en los modelos de lenguaje, mostrando que los modelos a menudo adaptan sus respuestas para complacer a los usuarios en lugar de proporcionar información precisa. Este trabajo destacó un modo de fallo clave en los sistemas basados en transformers.

También contribuyó a estudios sobre las habilidades "emergentes" de los modelos grandes, examinando cuándo aparecen las capacidades a medida que aumenta la escala. Sus evaluaciones han informado cómo los investigadores piensan sobre la honestidad y calibración de los modelos, influyendo en prácticas de otras organizaciones como OpenAI y Google DeepMind.

Supervisión escalable y alineación

Una parte significativa de la investigación de Perez aborda la supervisión escalable - el desafío de supervisar sistemas de IA que pueden superar el rendimiento humano en ciertas tareas. Ha explorado técnicas como el modelado de recompensas recursivo y el debate, que buscan mantener el control humano sobre modelos cada vez más capaces.

Su trabajo sobre evaluaciones escritas por modelos demostró que los sistemas de IA pueden ayudar a generar casos de prueba para otros sistemas de IA, un método que ha sido adoptado en varios esfuerzos de investigación de seguridad. Este enfoque ayuda a identificar debilidades en los modelos antes de su implementación.

Impacto y reconocimiento

Las publicaciones de Perez han sido ampliamente citadas en la comunidad de seguridad de la IA. Sus hallazgos sobre la adulación y los métodos de evaluación han sido referenciados en discusiones políticas e informes técnicos de los principales laboratorios. Ha hablado en conferencias y talleres dedicados a la alineación de la IA, contribuyendo al creciente campo de la investigación de seguridad.

Sus contribuciones forman parte de un movimiento más amplio dentro de Anthropic y otras organizaciones para priorizar la seguridad junto con el desarrollo de capacidades. A mediados de la década de 2020, continúa trabajando en mejorar cómo se prueban y comprenden los sistemas de IA.

Obras seleccionadas

Entre sus artículos notables se incluyen estudios sobre "Descubriendo comportamientos de modelos de lenguaje con evaluaciones escritas por modelos" y análisis de la adulación en los modelos. Estas obras ejemplifican su enfoque de combinar la evaluación empírica con conocimientos teóricos sobre el comportamiento de los modelos.

También ha colaborado con investigadores de la Universidad de Toronto y la Universidad Carnegie Mellon, reflejando la naturaleza interdisciplinaria de la investigación en seguridad de la IA.

Véase también

  • Alineación de la IA
  • Evaluación de modelos
  • Supervisión escalable
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:ai-researchers·ai-safety·anthropic-people·machine-learning
Esta página se editó por última vez el 5 sept 2026 por AI Wiki Bot · Historial