TF-IDF (frecuencia de término - frecuencia inversa de documento) es una estadística numérica diseñada para reflejar la importancia de una palabra en un documento dentro de una colección o corpus. Es el producto de dos componentes: la frecuencia de término (TF), que mide cuántas veces aparece un término en un documento, y la frecuencia inversa de documento (IDF), que reduce el peso de los términos que aparecen con frecuencia en muchos documentos. La técnica se desarrolló en la década de 1970 y se convirtió en un método fundamental en la recuperación de información, la clasificación de textos y la clasificación de motores de búsqueda antes del auge de los enfoques basados en aprendizaje automático y redes neuronales.
La intuición central detrás de TF-IDF es que un término que aparece con frecuencia en un solo documento pero raramente en el resto del corpus probablemente sea muy descriptivo del contenido de ese documento. Por el contrario, palabras comunes como "el" o "y" aparecen en casi todos los documentos y, por lo tanto, tienen poco poder discriminativo. Al combinar la frecuencia local con la rareza global, TF-IDF asigna a cada par término-documento un peso que puede usarse para representar documentos como vectores en un espacio de alta dimensión, lo que permite cálculos de similitud y agrupamiento.
Desarrollo Histórico
El concepto de ponderar términos según su frecuencia en documentos tiene raíces en las décadas de 1950 y 1960, con trabajos tempranos de Hans Peter Luhn en Xerox PARC y otros. La formulación moderna de TF-IDF se atribuye a menudo a Karen Spärck Jones, quien publicó un artículo seminal en 1972 titulado "Una interpretación estadística de la especificidad de términos y su aplicación en la recuperación". Su trabajo estableció el componente de frecuencia inversa de documento como un factor de escala logarítmico. Refinamientos posteriores de Gerard Salton y sus colegas en la Universidad de Cornell integraron TF-IDF en el sistema de recuperación de información SMART, que se convirtió en una plataforma de investigación estándar.
Formulación Matemática
Para un término \( t \) en un documento \( d \), la frecuencia de término \( tf(t,d) \) es típicamente el recuento bruto de ocurrencias, aunque las variantes usan escala logarítmica o presencia binaria. La frecuencia inversa de documento se define como:
\[ idf(t) = \log \frac{N}{df(t)} \]
donde \( N \) es el número total de documentos en el corpus y \( df(t) \) es el número de documentos que contienen el término. El peso TF-IDF es entonces:
\[ tfidf(t,d) = tf(t,d) \times idf(t) \]
En la práctica, a menudo se añade suavizado para evitar la división por cero para términos ausentes del corpus, y se aplica normalización (como la normalización L2) a los vectores de documento para mitigar el sesgo de longitud.
Aplicaciones en Recuperación de Información
En los sistemas clásicos de recuperación de información, los pesos TF-IDF se usan para clasificar documentos frente a una consulta de usuario. La consulta se representa como un vector de pesos TF-IDF, y los documentos se clasifican por similitud de coseno entre el vector de consulta y cada vector de documento. Este modelo de espacio vectorial, popularizado por Salton, fue el enfoque dominante para motores de búsqueda en las décadas de 1980 y 1990. TF-IDF también sustenta muchas tareas de minería de textos, incluidos el agrupamiento de documentos, la extracción de palabras clave y el resumen automático.
Limitaciones y Contexto Moderno
TF-IDF tiene varias limitaciones conocidas. Trata los términos como independientes, ignorando las relaciones semánticas y el orden de las palabras. También funciona mal en documentos o consultas cortas debido a la superposición escasa de términos. Con la llegada de los grandes modelos de lenguaje y las arquitecturas basadas en transformadores, los vectores densos de incrustación han reemplazado en gran medida a TF-IDF en muchas tareas, ya que capturan el significado contextual. Sin embargo, TF-IDF sigue siendo ampliamente utilizado como línea base, como característica para modelos tradicionales de aprendizaje automático y en dominios con recursos computacionales limitados. También es un componente común en sistemas de recuperación híbridos que combinan señales dispersas y densas.
Variantes y Extensiones
Existen varias variantes de TF-IDF, incluido BM25 (Best Matching 25), que introduce saturación de frecuencia de término y normalización de longitud de documento, y a menudo se prefiere en sistemas de búsqueda modernos. Otras extensiones incorporan etiquetado de partes del discurso o usan escala TF sublineal. La función de clasificación Okapi BM25, desarrollada en la década de 1990 por Stephen Robertson y Karen Spärck Jones, sigue siendo un estándar en la recuperación de información y se usa en muchos motores de búsqueda de código abierto como Elasticsearch.
Véase También
- Recuperación de información
- Aprendizaje automático
- Procesamiento de lenguaje natural
- Modelo de espacio vectorial