Modelo de bolsa de palabras

Traducido del inglés

El modelo de bolsa de palabras es una técnica de representación de texto que convierte documentos en multiconjuntos de palabras, ignorando la gramática y el orden de las palabras. Es un método fundamental en el procesamiento del lenguaje natural y el aprendizaje automático, utilizado a menudo como referencia para la clasificación de texto y la recuperación de información.

El modelo de bolsa de palabras es una representación simplificadora utilizada en el procesamiento del lenguaje natural y la recuperación de información. En este modelo, un texto como una oración o documento se representa como un multiconjunto de sus palabras, ignorando la gramática y el orden de las palabras pero conservando la multiplicidad. El nombre proviene de la idea de que un texto puede verse como una "bolsa" de palabras, donde se pierde la estructura y solo importan los recuentos de palabras. Es una línea base común en aprendizaje automático y inteligencia artificial para tareas como la clasificación de textos, el análisis de sentimientos y la recuperación de documentos.

Cómo funciona

La construcción de una representación de bolsa de palabras comienza con la tokenización, el proceso de dividir un texto en palabras o tokens individuales. La puntuación suele eliminarse y las palabras a menudo se convierten a minúsculas. Luego se construye un vocabulario a partir de todos los tokens únicos que aparecen en un corpus de documentos. Cada documento se convierte en un vector de recuentos, donde cada dimensión corresponde a una palabra del vocabulario y el valor es el número de veces que esa palabra aparece en el documento. Este vector es disperso, porque la mayoría de los documentos contienen solo una pequeña fracción del vocabulario.

Por ejemplo, la oración "el gato se sentó en la alfombra" produciría un vector con recuentos: "el" aparece dos veces, y "gato", "sentó", "en", "alfombra" aparecen una vez cada uno. El orden de las palabras se ignora por completo, por lo que "el gato se sentó" y "sentó se gato el" darían la misma representación. Esta pérdida de información sobre el orden es la limitación principal del modelo, pero también hace que la representación sea simple y computacionalmente eficiente.

Aplicaciones y limitaciones

Las representaciones de bolsa de palabras se usaron ampliamente en pipelines clásicos de aprendizaje automático antes del auge del aprendizaje profundo. Sirven como características de entrada para algoritmos como la regresión logística, las máquinas de vectores de soporte y los clasificadores ingenuos de Bayes. En la recuperación de información, el modelo de espacio vectorial, introducido por Gerard Salton y sus colegas en 1975, representa documentos y consultas como vectores de bolsa de palabras y los compara mediante similitud de coseno.

El modelo tiene varias limitaciones conocidas. No puede capturar el orden de las palabras, por lo que frases como "no bueno" y "bueno no" se tratan de manera idéntica. También ignora la semántica: sinónimos como "coche" y "automóvil" se tratan como dimensiones separadas, mientras que palabras polisémicas como "banco" se confunden. Los vectores resultantes son de alta dimensionalidad y dispersos, lo que puede conducir a sobreajuste y mala generalización cuando el vocabulario es grande. Para mitigar estos problemas, los profesionales suelen aplicar esquemas de ponderación como la frecuencia de término-frecuencia inversa de documento (TF-IDF) o usar n-gramas para capturar secuencias cortas.

Variantes y extensiones

Varias extensiones abordan las debilidades del modelo básico de bolsa de palabras. TF-IDF reemplaza los recuentos brutos con pesos que reducen la importancia de las palabras comunes y enfatizan las raras. Los modelos de n-gramas extienden la bolsa para incluir secuencias contiguas de n palabras, preservando algo de información de orden local. El truco de hashing mapea palabras a un vector de tamaño fijo usando una función hash, evitando la necesidad de almacenar un vocabulario. Estos métodos siguen siendo útiles en muchas aplicaciones, particularmente cuando los datos etiquetados son escasos.

Otra extensión importante es el uso de incrustaciones de palabras, que mapean palabras a vectores densos de baja dimensión que capturan similitud semántica. A diferencia de la bolsa de palabras, las incrustaciones preservan algunas relaciones entre palabras. Sin embargo, las incrustaciones generalmente se aprenden mediante métodos de redes neuronales, que requieren más datos y cálculo. El modelo de bolsa de palabras sigue siendo una línea base sólida: en muchas tareas de clasificación de textos, un clasificador lineal sobre características de bolsa de palabras puede igualar el rendimiento de modelos más complejos.

Relación con la IA moderna

Con la llegada de los grandes modelos de lenguaje y la arquitectura transformador, las representaciones de bolsa de palabras han sido en gran medida superadas para tareas complejas de comprensión del lenguaje natural. La arquitectura del transformador, introducida en 2017, usa codificación posicional para inyectar información sobre el orden de las palabras y atención de múltiples cabezas para modelar relaciones entre todas las palabras de una secuencia. Estos mecanismos permiten que los modelos capturen contexto y dependencias de largo alcance que son invisibles para una representación de bolsa de palabras. Arquitecturas como secuencia a secuencia y modelos codificador-decodificador también dependen de incrustaciones aprendidas en lugar de vectores basados en recuentos.

No obstante, el modelo de bolsa de palabras continúa influyendo en la IA moderna. A menudo se usa como un paso de extracción de características en sistemas híbridos, y su simplicidad lo convierte en una herramienta pedagógica útil para comprender conceptos de aprendizaje automático. El modelo también aparece en aplicaciones de IA generativa como línea base para evaluar representaciones más sofisticadas. Incluso mientras avanza el aprendizaje profundo, el modelo de bolsa de palabras sigue siendo un concepto fundamental en la historia del procesamiento del lenguaje natural.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·text-representation·machine-learning·information-retrieval
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial