Traducido del inglés

Stephen Merce es un científico investigador en Google DeepMind especializado en procesamiento de lenguaje natural, conocido por sus contribuciones a los modelos de lenguaje grandes y a los métodos de entrenamiento eficientes.

Stephen Merce es un científico investigador en Google DeepMind, donde trabaja en el procesamiento del lenguaje natural (PLN) y en sistemas de aprendizaje automático a gran escala. Su investigación se centra en mejorar la eficiencia y la fiabilidad de los grandes modelos de lenguaje, particularmente en las áreas de dinámicas de entrenamiento, optimización y evaluación de modelos. Merce ha estado activo en el campo desde mediados de la década de 2010, contribuyendo tanto a la literatura académica como a los sistemas de IA desplegados.

El trabajo de Merce se sitúa en la intersección de la inteligencia artificial y el aprendizaje automático, con un fuerte énfasis en las arquitecturas de aprendizaje profundo. Ha colaborado con investigadores de múltiples instituciones, incluyendo la Universidad de Toronto y el Laboratorio de IA de Stanford, y sus artículos han aparecido en conferencias importantes como NeurIPS, ICML y ACL. Su investigación actual en Google DeepMind implica desarrollar métodos para escalar los modelos transformer mientras se reducen los costos computacionales y se mejora la interpretabilidad.

Inicios de Carrera y Educación

Merce completó sus estudios de grado en ciencias de la computación en la Universidad Carnegie Mellon en 2012, donde se interesó por primera vez en la IA y el PLN. Luego realizó un doctorado en la Universidad de Toronto bajo la supervisión de Aaron Courville, centrándose en el aprendizaje secuencia a secuencia y los mecanismos de atención. Su tesis doctoral, completada en 2017, introdujo enfoques novedosos para la atención multi-cabeza que mejoraron la calidad de la traducción mientras reducían el número de parámetros.

Durante su doctorado, Merce realizó una pasantía en OpenAI en 2016, donde trabajó en versiones tempranas de modelos generativos. Esta experiencia moldeó su interés posterior en métodos de entrenamiento escalables. Después de graduarse, pasó dos años como investigador postdoctoral en Berkeley AI Research, colaborando con Anima Anandkumar en métodos basados en tensores para la compresión de redes neuronales.

Contribuciones a los Modelos de Lenguaje

En Google DeepMind, Merce ha participado en varios proyectos relacionados con la IA generativa. Contribuyó al desarrollo de mecanismos de atención eficientes, incluyendo una variante de atención cruzada que reduce el uso de memoria en tareas de contexto largo. Su artículo de 2021, "Efficient Attention via Sparse Factorization", introdujo un método que logró una aceleración del 30% en los puntos de referencia de traducción automática mientras mantenía la precisión.

Merce también trabajó en esquemas de codificación posicional para transformers, proponiendo una codificación posicional aprendible que se adapta a entradas de longitud variable. Este trabajo ha sido citado en investigaciones posteriores sobre modelos secuencia a secuencia y ha influido en el diseño de varios modelos de lenguaje de código abierto.

En 2022, colaboró con investigadores de Anthropic en un estudio sobre la estabilidad de RLHF (aprendizaje por refuerzo a partir de retroalimentación humana). El artículo conjunto, publicado en ICML 2023, analizó el impacto de los programas de tasa de aprendizaje en el "reward hacking", proporcionando pautas prácticas para entrenar modelos alineados. Esta colaboración no condujo a un proyecto conjunto formal, pero resultó en un informe técnico ampliamente discutido.

Métodos de Optimización y Entrenamiento

Una parte significativa de la investigación de Merce aborda los desafíos de optimización en el aprendizaje profundo. Ha publicado sobre variantes del optimizador Adam, proponiendo un método de tasa de aprendizaje adaptativa que mejora la convergencia en objetivos no convexos. Su artículo de 2019, "Adaptive Clipping for Stable Training", introdujo una técnica de recorte de gradientes que previene gradientes explosivos en transformers grandes, la cual ha sido adoptada en varios pipelines de entrenamiento industrial.

Merce también ha explorado estrategias de aprendizaje curricular para modelos de lenguaje, mostrando que ordenar los datos de entrenamiento por dificultad puede reducir el número de pasos necesarios para alcanzar una perplejidad objetivo. Sus experimentos sobre aumento de datos para tareas de PLN demostraron que los datos sintéticos generados por modelos más pequeños pueden complementar eficazmente los conjuntos de datos anotados por humanos.

Evaluación e Interpretabilidad

En los últimos años, Merce se ha centrado en métricas de evaluación para grandes modelos de lenguaje. Coautoró un artículo de 2023 que propone un nuevo punto de referencia para la consistencia fáctica en la summarización, que ha sido utilizado por equipos en Google Cloud y AWS para evaluar la fiabilidad de los modelos. Su trabajo sobre poda de modelos ha demostrado que hasta el 40% de los parámetros en un transformer entrenado pueden eliminarse sin una pérdida significativa de rendimiento, permitiendo un despliegue más eficiente en dispositivos periféricos.

Merce también está interesado en la interpretabilidad, particularmente en comprender cómo las redes neuronales representan la estructura lingüística. Ha utilizado clasificadores de sondeo para analizar las representaciones internas de los transformers, revelando que ciertas capas codifican información sintáctica más fuertemente que otras. Esta investigación tiene implicaciones para depurar y mejorar el rendimiento de los modelos.

Colaboraciones e Impacto

Merce ha mantenido colaboraciones con instituciones académicas, incluyendo MIT CSAIL y la Universidad de Oxford. Ha servido como revisor para conferencias importantes y ha sido miembro del comité de programa para ACL y EMNLP. Su trabajo ha sido citado en más de 3,000 artículos académicos, según Google Scholar, aunque este número es aproximado e incluye autocitas.

Dentro de Google DeepMind, Merce ha trabajado con Jakob Uszkoreit y Lukasz Kaiser en mejoras de transformers, aunque la naturaleza exacta de estas colaboraciones no está documentada públicamente. También ha sido mentor de varios pasantes que han pasado a ocupar posiciones en OpenAI y Apple.

Premios y Reconocimientos

Merce recibió el Premio al Mejor Artículo en el Taller de PLN Eficiente de 2020, un evento más pequeño, por su trabajo sobre atención dispersa. También fue finalista del Premio de Investigación de Facultad de Google 2022, aunque no lo ganó. En 2023, fue invitado a dar una conferencia magistral en la Conferencia sobre Modelado de Lenguaje, donde presentó sus puntos de vista sobre el futuro de la IA eficiente.

Trabajo Actual y Direcciones Futuras

A partir de 2025, Merce lidera un proyecto en Google DeepMind sobre aprendizaje continuo para modelos de lenguaje, con el objetivo de permitir que los modelos actualicen su conocimiento sin olvido catastrófico. Este trabajo implica técnicas de normalización por lotes adaptadas para capas de transformer y explora el uso de escalado de temperatura para controlar la diversidad de salida durante el ajuste fino.

Merce también ha expresado interés en la intersección de la IA y el hardware, colaborando con equipos en AMD y Intel para optimizar la inferencia en sus aceleradores. Aunque estos esfuerzos son preliminares, reflejan una tendencia más amplia hacia el diseño conjunto de algoritmos y chips.

Publicaciones Seleccionadas

  • "Efficient Attention via Sparse Factorization" (2021)
  • "Adaptive Clipping for Stable Training" (2019)
  • "Probing Linguistic Structure in Transformer Representations" (2020)
  • "Curriculum Learning for Neural Machine Translation" (2018)
  • "On the Stability of RLHF" (con investigadores de Anthropic, 2023)

Referencias

Las publicaciones de Merce están indexadas en bases de datos importantes como DBLP y Google Scholar. Su perfil en Google DeepMind enumera sus intereses de investigación y artículos seleccionados, aunque no proporciona una biografía completa. Este artículo se basa en información disponible públicamente y puede no capturar todos los aspectos de su carrera.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-science·natural-language-processing·google-deepmind·researchers
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial