Traducido del inglés

Yinfei Yang es una científica informática en Google Research, conocida por coautorar BERT, un modelo basado en transformadores para el aprendizaje de representaciones del lenguaje natural, y por sus contribuciones a la generación de lenguaje natural y a los embeddings de oraciones.

Yinfei Yang es un informático y científico investigador en Google, reconocido por coescribir BERT, un modelo basado en transformadores que avanzó el aprendizaje de representaciones en el procesamiento del lenguaje natural. Sus intereses de investigación incluyen generación de lenguaje natural, modelado Sequence-to-Sequence (Seq2Seq) y aprendizaje automático. Ha contribuido tanto a los fundamentos teóricos como a las aplicaciones prácticas de la inteligencia artificial en la comprensión del lenguaje.

Carrera e investigación

Yang trabaja en Google Research, donde se ha centrado en la comprensión y generación del lenguaje natural. Coescribió el artículo de 2018 que introdujo BERT, que se convirtió en un modelo fundamental para los grandes modelos de lenguaje. Otro de sus trabajos notables incluye el Universal Sentence Encoder, un modelo para aprender incrustaciones de oraciones que ha sido ampliamente adoptado en sistemas de producción. También ha contribuido a la investigación sobre generación de texto, incluido el trabajo en arquitecturas Encoder-Decoder Architecture y mecanismos de atención de múltiples cabezas. Su investigación a menudo involucra redes neuronales entrenadas a gran escala.

BERT y aprendizaje de representaciones bidireccional

BERT, abreviatura de Bidirectional Encoder Representations from Transformers, se introdujo en el artículo "BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding" publicado en 2018. El modelo utiliza un codificador transformador con codificaciones posicionales, normalización de capas, conexiones residuales y abandono durante el entrenamiento. Fue preentrenado en un corpus grande utilizando objetivos de modelado de lenguaje enmascarado y predicción de la siguiente oración. BERT-base contiene 110 millones de parámetros, mientras que BERT-large contiene 340 millones. El modelo logró resultados de vanguardia en varios puntos de referencia de procesamiento del lenguaje natural, incluida la puntuación GLUE y la tarea de respuesta a preguntas SQuAD. Su enfoque de entrenamiento bidireccional le permitió capturar contexto desde ambas direcciones, mejorando el rendimiento en tareas que requieren comprensión de las relaciones entre palabras. Entrenar tales modelos requirió una cuidadosa programación de la tasa de aprendizaje y el uso del optimizador Adam.

Universal Sentence Encoder

Yang coescribió el Universal Sentence Encoder, un modelo que mapea oraciones a vectores de longitud fija. El modelo se basa en una arquitectura de transformador y se entrenó en una variedad de fuentes de datos, incluidas noticias web, páginas de preguntas y respuestas y foros de discusión. Admite aprendizaje por transferencia para tareas como similitud semántica, clasificación de texto y agrupamiento. El Universal Sentence Encoder se ha publicado como una herramienta para desarrolladores e investigadores, permitiendo representaciones eficientes a nivel de oración sin necesidad de entrenamiento específico para la tarea. Este trabajo ha sido influyente en el área de incrustación de oraciones y búsqueda semántica.

Generación de lenguaje natural e impacto

Las contribuciones de Yang a la generación de lenguaje natural incluyen trabajo en modelos de secuencia a secuencia y técnicas para generar texto coherente y contextualmente relevante. En esta área, estrategias de decodificación como búsqueda de haz se utilizan comúnmente para mejorar la calidad de la salida. Su trabajo se ha aplicado a tareas como resumen, sistemas de diálogo y respuesta a preguntas. Los métodos de aprendizaje de representaciones que ayudó a desarrollar, particularmente BERT, han tenido un impacto duradero en el campo. Permitieron un ajuste fino más efectivo para tareas posteriores y sirvieron como bloques de construcción para modelos de lenguaje grandes posteriores y sistemas de IA generativa. Su trabajo en incrustaciones de oraciones también influyó en los enfoques de similitud semántica de texto y recuperación.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-scientist·natural-language-processing·google-research·machine-learning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial