Jeffrey Kaplan es un científico de la computación especializado en inteligencia artificial y aprendizaje automático. Es más conocido por su papel como coautor del artículo que presentó GPT-3, uno de los grandes modelos de lenguaje más grandes e influyentes desarrollados por OpenAI. El trabajo de Kaplan ha contribuido a comprender el comportamiento de escala de las redes neuronales y al desarrollo de sistemas de IA más seguros.
Los intereses de investigación de Kaplan se centran en la intersección de la escala de modelos, la dinámica de entrenamiento y la alineación de la IA. Sus contribuciones han ayudado a dar forma al enfoque moderno para construir sistemas de IA generativa, particularmente en las áreas de arquitectura de modelos y predicción de rendimiento.
Inicios de carrera y educación
Kaplan completó sus estudios de pregrado en física y matemáticas, donde desarrolló una sólida base en razonamiento cuantitativo. Posteriormente cursó estudios de posgrado en aprendizaje automático, centrándose en modelos probabilísticos y técnicas de optimización. Durante sus años académicos, fue influenciado por la comunidad de investigación más amplia en instituciones como MIT CSAIL y Laboratorio de IA de Stanford, aunque sus nombramientos directos fueron en la industria privada.
Su trabajo inicial involucró la aplicación de aprendizaje profundo a tareas de procesamiento de lenguaje natural, lo que finalmente lo llevó a unirse a OpenAI en 2019. En ese momento, OpenAI estaba haciendo la transición de la investigación en aprendizaje por refuerzo a la escala de modelos basados en transformadores.
GPT-3 y leyes de escalado
La contribución más notable de Kaplan llegó en 2020 cuando coautorizó el artículo "Language Models are Few-Shot Learners", que presentó GPT-3. Este modelo, con 175 mil millones de parámetros, demostró que transformadores a gran escala podían realizar una amplia gama de tareas con un ajuste mínimo, dependiendo del aprendizaje en contexto. El papel de Kaplan incluyó el diseño experimental y el análisis del comportamiento del modelo en diferentes tamaños.
Antes de GPT-3, Kaplan fue autor principal de un estudio en 2020 que examinaba las leyes de escalado para redes neuronales de lenguaje. Ese trabajo estableció relaciones de potencia predecibles entre el tamaño del modelo, el tamaño del conjunto de datos y el algún presupuesto de cómputo, guiando cómo OpenAI asignó recursos para los modelos subsiguiente. Estos hallazgos influyeron en desarrollos posteriores en arquitectura de modelos, como las mejoras de red residual y las técnicas de normalización de capas utilizadas en los LLM modernos.
Transición a Anthropic
En 2021, Kaplan abandonó OpenAI para incorporarse a Anthropic, una empresa rival de seguridad en IA cofundada por antiguos investigadores de OpenAI. En Anthropic, su enfoque se centró en la investigación en interpretabilidad y alineación, particularmente en torno a RLHF (entrenamiento por refuerzo con retroalimentación humana) y técnicas para reducir salidas dañinas. Contribuyó al desarrollo de Claude, el modelo de asistente de Anthropic, haciendo hincapié en los principios de IA constitucional.
Su trabajo en Anthropic exploró cómo hacer modelos más transparentes y controlados, abordando cuestiones como la alucinación y el sesgo. También investigó los efectos del escalado de temperatura y la muestra sujetada en top-p sobre la diversidad de producción, con el objetivoo de equilibrar la creatividad con la seguridad.
Contribuciones de investigación
La cartera de investigación de Kaplan incluye estudios sobre algoritmos de optimización, como el optimizador Adam y sus variantes, así como estrategias de aprendizaje en curriculum. También ha publicado sobre clip de gradientes y abandono condicionados a estabilizar el entrenamiento. Sus artículos coescritos suele enfatizar hallazgos empírales más que garantías teóricas.
Además de las leyes de escalado, ha contribuiдo a comprender los mecanismos de atención de múltiples cabezas y su papel en la captura de dependencias de largo alcance. Este trabajo tiene implicaciones para arquitectururas cadena a cadena y modelos codificador-decodificador usados en traducción y resumen.
Impacto más amplio e influencia en la industria
Los hallazgos de Kaplan sobre las leyes de escalado han sido ampliamente adoptados a través de toda la industria de la IA, incluyendo el desarrollo de hardware en empresas como AMD y Intel, aunque estas modestas de centrar en chips, no en modelos. Sus ideas ayudaron a justificar inversiones masivas en infraestructura computacional, como los servicios de nube AWS y Azure, para el entrenamiento de modelos grandes. Notablemente, su trabajo también ha sido citado en investigaciones de grupos de Google DeepMind y [[university-of-toronto|Universidad de Toronto].
Su llamamiento a un escalado cuidad siempre ha fomentado discusiones sobre los costos ambiental y económico del entrenamiento de modelos, guiando el interés en técnicas de podaje de modelos y eficiencia. La doble atención de Kaplan en rendimiento y seguridad lo ubica entre un pequeño grupo de investigadores que unen el trabajo de capacidades de punta con productividad con las preocupaciones de alineamiento.
Vida personal y legado
Poco se sabe públicamente sobre la vida personal de Kaplan, ya que mantiene contrarr un perfil bajo fuera de sus publicaciones profesionales. A partir de la mediados de la década de los años 20, sigue activo en la investigación de IA, colaborando a los esfuerzos continuos estudia y controles de los sistemas neuronales a gran escala. Su legado se vincula con el marco empírico que subyace a la generación actual de grandes modelos de lenguaje, que han convertido en integrantes en la aplicación modern de aprendizaje automático.