XLNet es un modelo de lenguaje basado en transformadores, presentado en 2019 por investigadores de Google y la Universidad Carnegie Mellon. Su nombre proviene de "eXtra Long NETwork". La innovación clave de XLNet es el uso de un objetivo de entrenamiento de "modelado de lenguaje autoregresivo permutado" (Permutation Language Modeling, PLM). A diferencia de los modelos autoregresivos tradicionales como GPT, que solo procesan el texto en una dirección (de izquierda a derecha), y de los modelos de tipo BERT que enmascaran tokens para predecirlos, XLNet considera todas las permutaciones posibles del orden de las palabras en una oración durante el entrenamiento. Esto le permite capturar dependencias bidireccionales y contextuales de manera más efectiva, superando algunas limitaciones de BERT, especialmente en tareas que requieren una comprensión profunda del contexto.
El modelo fue entrenado con una gran cantidad de datos y demostró un rendimiento de vanguardia en numerosas tareas de procesamiento de lenguaje natural (PLN), como respuesta a preguntas, análisis de sentimiento y clasificación de texto. Su arquitectura se basa en el transformador, pero con modificaciones específicas para manejar la permutación de tokens. Aunque XLNet fue un hito importante en el desarrollo de modelos de lenguaje, fue posteriormente superado por modelos más grandes y eficientes como T5 y GPT-3. No obstante, su contribución al campo es significativa, y su código fuente fue liberado bajo la licencia Apache 2.0, lo que permitió que investigadores y desarrolladores de todo el mundo lo utilizaran y adaptaran para sus propios proyectos.