Segmentación en subpalabras

Traducido del inglés

La tokenización en subpalabras es una técnica de preprocesamiento de texto que divide las palabras en unidades más pequeñas, equilibrando el tamaño del vocabulario y el significado. Sustenta los modelos de lenguaje modernos, con métodos como la codificación por pares de bytes (BPE) y WordPiece.

La tokenización por subpalabras es una técnica en el procesamiento del lenguaje natural que convierte texto sin procesar en una secuencia de tokens, donde cada token puede ser una palabra completa, una parte de una palabra o incluso un solo carácter. Se sitúa entre la tokenización a nivel de palabra, que trata cada palabra como una unidad indivisible, y la tokenización a nivel de carácter, que procesa el texto como caracteres individuales. Al utilizar unidades de subpalabras, los tokenizadores pueden manejar vocabularios grandes de manera eficiente, representar palabras raras o no vistas y preservar información morfológica significativa. Este enfoque es fundamental para los grandes modelos de lenguaje modernos y otras arquitecturas de redes neuronales que procesan texto.

La idea central es dividir las palabras en piezas más pequeñas que aparecen con frecuencia en el corpus de entrenamiento. Por ejemplo, la palabra "infelicidad" podría dividirse en "in", "felic" y "idad", o "infelicidad" podría mantenerse como un solo token si es lo suficientemente común. Esta flexibilidad permite que el modelo comprenda palabras novedosas combinando unidades de subpalabras conocidas, mientras mantiene un tamaño de vocabulario manejable. La tokenización por subpalabras se ha adoptado ampliamente desde mediados de la década de 2010 y es un componente clave de los modelos basados en transformers.

Historia y Desarrollo

El concepto de tokenización por subpalabras surgió de la necesidad de abordar problemas de vocabulario abierto en la traducción automática y el modelado del lenguaje. Los primeros enfoques en las décadas de 1990 y 2000 utilizaban análisis morfológico, pero a menudo eran específicos de cada idioma y computacionalmente costosos. Un gran avance llegó con la introducción de la Codificación por Pares de Bytes (BPE) para la compresión de texto, adaptada para la tokenización por Rico Sennrich y sus colegas en 2016. Su artículo "Neural Machine Translation of Rare Words with Subword Units" demostró que BPE podía manejar eficazmente palabras raras en modelos de secuencia a secuencia.

Alrededor de la misma época, el modelo WordPiece fue desarrollado en Google, inicialmente para el reconocimiento de voz y luego popularizado por BERT. Otra variante, el Modelo de Lenguaje Unigram, fue introducida por Taku Kudo en 2018 y utilizada en modelos como ALBERT y T5. Estos métodos difieren en cómo seleccionan las unidades de subpalabras, pero todos comparten el objetivo de encontrar una segmentación óptima del texto.

Métodos y Algoritmos

Codificación por Pares de Bytes (BPE)

BPE es un algoritmo de compresión de datos que fusiona iterativamente el par de símbolos consecutivos más frecuente (inicialmente caracteres) en un nuevo símbolo. Para la tokenización, el proceso comienza con un corpus de texto dividido en caracteres, luego cuenta repetidamente los pares adyacentes y fusiona el par más frecuente hasta alcanzar un tamaño de vocabulario objetivo. El vocabulario resultante contiene caracteres, subpalabras y palabras completas. BPE se utiliza en muchos modelos, incluida la serie GPT de OpenAI y LLaMA de Meta.

WordPiece

WordPiece es similar a BPE pero utiliza un criterio basado en la verosimilitud para la fusión. Construye un vocabulario comenzando con caracteres individuales y luego añadiendo nuevos tokens que maximizan la verosimilitud de los datos de entrenamiento. Este enfoque tiende a producir subpalabras más significativas lingüísticamente. WordPiece se utiliza en BERT, ELECTRA y otros modelos de Google.

Modelo de Lenguaje Unigram

La tokenización Unigram trata cada subpalabra como una unidad independiente y utiliza un modelo probabilístico para elegir la mejor segmentación para cada palabra. Comienza con un vocabulario grande de posibles subpalabras y luego lo poda según cuánto contribuye cada token a la verosimilitud general. Este método permite múltiples segmentaciones y se utiliza en implementaciones de SentencePiece.

Papel en los Modelos de Lenguaje Modernos

La tokenización por subpalabras es un paso de preprocesamiento crítico para casi todos los grandes modelos de lenguaje contemporáneos. Modelos como GPT-4, Claude y Gemini dependen de tokenizadores que convierten el texto en tokens de subpalabras antes de alimentarlos a la arquitectura transformer. La elección del tokenizador afecta el rendimiento del modelo, la eficiencia computacional y la capacidad de manejar múltiples idiomas.

Por ejemplo, un tokenizador con un vocabulario más grande puede representar más palabras como tokens individuales, reduciendo la longitud de la secuencia y el costo computacional, pero también puede aumentar la huella de memoria del modelo. Por el contrario, un vocabulario más pequeño obliga a dividir más palabras, lo que puede llevar a secuencias más largas y una posible pérdida de significado. Los tokenizadores se entrenan típicamente en corpus grandes y se mantienen fijos durante el entrenamiento del modelo.

La tokenización por subpalabras también permite la transferencia entre idiomas. Al compartir unidades de subpalabras entre lenguas, los modelos pueden manejar mejor el cambio de código y las palabras raras en idiomas con pocos recursos. Esto es particularmente importante para modelos multilingües como mBERT y XLM-RoBERTa.

Desafíos y Direcciones Futuras

A pesar de su uso generalizado, la tokenización por subpalabras tiene limitaciones. Un problema es que puede producir segmentaciones arbitrarias que no se alinean con los límites morfológicos, lo que dificulta que los modelos aprendan la estructura de las palabras. Otro desafío es el manejo de palabras fuera de vocabulario, especialmente en dominios especializados como medicina o derecho, donde aparecen nuevos términos con frecuencia. Algunos investigadores han propuesto la tokenización a nivel de carácter o de byte para evitar estos problemas, pero estos enfoques a menudo requieren secuencias más largas y más computación.

Los desarrollos recientes incluyen la tokenización adaptativa, donde el tokenizador puede ajustarse durante el entrenamiento, y modelos de extremo a extremo que aprenden a segmentar texto sin un tokenizador fijo. Sin embargo, a partir de 2025, la tokenización por subpalabras sigue siendo el estándar en la mayoría de los sistemas de producción, y la investigación en curso tiene como objetivo mejorar su eficiencia y calidad lingüística.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·tokenization·machine-learning·text-preprocessing
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial