Traducido del inglés

PEGASUS es un modelo preentrenado basado en transformadores para el resumen abstractivo de texto, introducido por Google en 2019, que utiliza la generación de oraciones con huecos para aprender de grandes corpus. Logra un rendimiento sólido en diversos puntos de referencia de resumen.

PEGASUS (Pre-training with Extracted Gap-sentences for Abstractive SUmmarization) es un modelo de lenguaje desarrollado por investigadores de Google para la tarea de resumen abstractivo de textos. Presentado en 2019, aprovecha la arquitectura Transformer (architecture) y un novedoso objetivo de preentrenamiento autosupervisado denominado generación de oraciones con huecos. A diferencia de los métodos extractivos que seleccionan oraciones textualmente, PEGASUS genera nuevas oraciones que parafrasean el documento fuente, con el objetivo de producir resúmenes concisos y coherentes.

El modelo fue preentrenado con un gran corpus de texto web y artículos de noticias, donde aprendió a predecir oraciones enmascaradas basándose en el contexto circundante. Este enfoque se alinea estrechamente con la tarea de resumen, lo que permite al modelo capturar información relevante y generar resúmenes fluidos. PEGASUS logró resultados de última generación en múltiples puntos de referencia, incluidos el conjunto de datos CNN/Daily Mail y el conjunto de datos XSum, y demostró sólidas capacidades multilingües.

Arquitectura y preentrenamiento

PEGASUS se basa en la arquitectura estándar de codificador-decodificador transformer, similar a otros modelos de secuencia a secuencia. El codificador procesa el documento de entrada, mientras que el decodificador genera el resumen token a token. La innovación clave reside en su objetivo de preentrenamiento: la generación de oraciones con huecos. Durante el preentrenamiento, el modelo selecciona y enmascara aleatoriamente oraciones completas de un documento, y luego se entrena para reconstruir esas oraciones utilizando el texto restante. Esto obliga al modelo a comprender el significado general del documento e identificar la información más importante, lo que se transfiere directamente a la tarea de resumen.

El corpus de preentrenamiento comprendió más de 500 millones de oraciones de diversas fuentes, incluidos artículos de noticias, páginas web y artículos científicos. El modelo se entrenó con un tamaño de lote grande y una estrategia de enmascaramiento dinámico, donde el número y la posición de las oraciones enmascaradas variaban. Esta configuración permitió a PEGASUS aprender representaciones robustas del contenido textual y generar resúmenes que son tanto abstractivos como fieles a la fuente.

Rendimiento y puntos de referencia

PEGASUS fue evaluado en una amplia gama de conjuntos de datos de resumen, incluidos CNN/Daily Mail, XSum y el conjunto de datos multilingüe WikiHow. En CNN/Daily Mail, logró una puntuación ROUGE-1 de 44,17, superando a modelos anteriores como BART y T5. En XSum, que requiere resúmenes altamente abstractivos, PEGASUS obtuvo una puntuación ROUGE-1 de 25,57, lo que demuestra su capacidad para generar oraciones novedosas en lugar de extraer las existentes. El modelo también funcionó bien en tareas con pocos recursos, mostrando que el preentrenamiento con grandes corpus permite un ajuste fino efectivo con datos etiquetados limitados.

Además del inglés, PEGASUS se adaptó a varios idiomas, incluidos francés, español y alemán, mediante preentrenamiento multilingüe. Esta versión, conocida como mPEGASUS, logró resultados competitivos en puntos de referencia de resumen multilingüe, lo que destaca la versatilidad del modelo.

Aplicaciones e impacto

PEGASUS ha sido ampliamente adoptado tanto en la investigación académica como en la industria. Su capacidad para generar resúmenes fluidos e informativos se ha aplicado a la agregación de noticias, el resumen de documentos y los sistemas de preguntas y respuestas. El enfoque de preentrenamiento del modelo también ha influido en trabajos posteriores en IA generativa, particularmente en el desarrollo de modelos de resumen más eficientes y efectivos. Los investigadores han utilizado PEGASUS como punto de referencia para comparar nuevas arquitecturas y estrategias de preentrenamiento.

La publicación de PEGASUS como modelo de código abierto a través de las bibliotecas TensorFlow y PyTorch facilitó su integración en diversas aplicaciones. Ha sido utilizado por empresas e instituciones de investigación para construir herramientas de resumen que manejan documentos largos, como contratos legales e informes médicos. El rendimiento del modelo en conjuntos de datos específicos de dominio se ha mejorado aún más mediante el ajuste fino, lo que lo convierte en una opción práctica para muchos casos de uso del mundo real.

Limitaciones y direcciones futuras

A pesar de sus fortalezas, PEGASUS tiene ciertas limitaciones. En ocasiones puede producir resúmenes que son inconsistentes con los hechos de la fuente, un problema común en el resumen abstractivo. El modelo también requiere recursos computacionales significativos para el preentrenamiento, aunque el ajuste fino es relativamente ligero. Modelos posteriores, como los basados en la serie GPT de OpenAI y Claude de Anthropic, han explorado enfoques alternativos para el resumen, incluido el aprendizaje por refuerzo y el ajuste por instrucciones.

La investigación futura se ha centrado en mejorar la precisión factual y reducir la alucinación en los resúmenes generados. Se han propuesto técnicas como el aprendizaje contrastivo y módulos de verificación de hechos para abordar estos desafíos. Además, se ha explorado la integración de PEGASUS con la generación aumentada por recuperación y la búsqueda neuronal para manejar documentos muy largos y necesidades de resumen en tiempo real.

Legado

PEGASUS representa un hito significativo en el desarrollo de modelos de resumen abstractivo. Su objetivo de generación de oraciones con huecos proporcionó una estrategia de preentrenamiento simple pero efectiva que imita de cerca la tarea de resumen. El éxito del modelo demostró la importancia del preentrenamiento específico para la tarea, influyendo en modelos posteriores como T5 y BART. A principios de la década de 2020, PEGASUS sigue siendo un punto de referencia para la investigación en resumen y una herramienta práctica para generar resúmenes de alta calidad en diversos dominios.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·summarization·transformer·google
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial