Yinfei Yang es un informático y científico investigador en Google, reconocido por coescribir BERT, un modelo basado en transformadores que avanzó el aprendizaje de representaciones en el procesamiento del lenguaje natural. Sus intereses de investigación incluyen generación de lenguaje natural, modelado Sequence-to-Sequence (Seq2Seq) y aprendizaje automático. Ha contribuido tanto a los fundamentos teóricos como a las aplicaciones prácticas de la inteligencia artificial en la comprensión del lenguaje.
Carrera e investigación
Yang trabaja en Google Research, donde se ha centrado en la comprensión y generación del lenguaje natural. Coescribió el artículo de 2018 que introdujo BERT, que se convirtió en un modelo fundamental para los grandes modelos de lenguaje. Otro de sus trabajos notables incluye el Universal Sentence Encoder, un modelo para aprender incrustaciones de oraciones que ha sido ampliamente adoptado en sistemas de producción. También ha contribuido a la investigación sobre generación de texto, incluido el trabajo en arquitecturas Encoder-Decoder Architecture y mecanismos de atención de múltiples cabezas. Su investigación a menudo involucra redes neuronales entrenadas a gran escala.
BERT y aprendizaje de representaciones bidireccional
BERT, abreviatura de Bidirectional Encoder Representations from Transformers, se introdujo en el artículo "BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding" publicado en 2018. El modelo utiliza un codificador transformador con codificaciones posicionales, normalización de capas, conexiones residuales y abandono durante el entrenamiento. Fue preentrenado en un corpus grande utilizando objetivos de modelado de lenguaje enmascarado y predicción de la siguiente oración. BERT-base contiene 110 millones de parámetros, mientras que BERT-large contiene 340 millones. El modelo logró resultados de vanguardia en varios puntos de referencia de procesamiento del lenguaje natural, incluida la puntuación GLUE y la tarea de respuesta a preguntas SQuAD. Su enfoque de entrenamiento bidireccional le permitió capturar contexto desde ambas direcciones, mejorando el rendimiento en tareas que requieren comprensión de las relaciones entre palabras. Entrenar tales modelos requirió una cuidadosa programación de la tasa de aprendizaje y el uso del optimizador Adam.
Universal Sentence Encoder
Yang coescribió el Universal Sentence Encoder, un modelo que mapea oraciones a vectores de longitud fija. El modelo se basa en una arquitectura de transformador y se entrenó en una variedad de fuentes de datos, incluidas noticias web, páginas de preguntas y respuestas y foros de discusión. Admite aprendizaje por transferencia para tareas como similitud semántica, clasificación de texto y agrupamiento. El Universal Sentence Encoder se ha publicado como una herramienta para desarrolladores e investigadores, permitiendo representaciones eficientes a nivel de oración sin necesidad de entrenamiento específico para la tarea. Este trabajo ha sido influyente en el área de incrustación de oraciones y búsqueda semántica.
Generación de lenguaje natural e impacto
Las contribuciones de Yang a la generación de lenguaje natural incluyen trabajo en modelos de secuencia a secuencia y técnicas para generar texto coherente y contextualmente relevante. En esta área, estrategias de decodificación como búsqueda de haz se utilizan comúnmente para mejorar la calidad de la salida. Su trabajo se ha aplicado a tareas como resumen, sistemas de diálogo y respuesta a preguntas. Los métodos de aprendizaje de representaciones que ayudó a desarrollar, particularmente BERT, han tenido un impacto duradero en el campo. Permitieron un ajuste fino más efectivo para tareas posteriores y sirvieron como bloques de construcción para modelos de lenguaje grandes posteriores y sistemas de IA generativa. Su trabajo en incrustaciones de oraciones también influyó en los enfoques de similitud semántica de texto y recuperación.