La agrupación, también conocida como análisis de conglomerados, es una técnica de análisis de datos que divide un conjunto de objetos en grupos, o conglomerados, de modo que los objetos dentro del mismo grupo sean más similares entre sí que a los objetos de otros grupos, según una medida de similitud o distancia específica definida por el analista. Es una tarea principal del análisis exploratorio de datos y una técnica común para el análisis estadístico de datos, utilizada en campos como el reconocimiento de patrones, el análisis de imágenes, la recuperación de información, la bioinformática, la compresión de datos, los gráficos por computadora y el aprendizaje automático. Como método de aprendizaje no supervisado, la agrupación no se basa en datos etiquetados; en cambio, descubre estructuras y agrupaciones inherentes en los datos sin conocimiento previo de las etiquetas de clase.
El término "agrupación" abarca una familia de algoritmos y tareas, más que un único algoritmo específico. Los diferentes algoritmos varían significativamente en su comprensión de lo que constituye un conglomerado y en cómo identificar eficientemente los conglomerados. Las nociones populares de conglomerados incluyen grupos con pequeñas distancias entre miembros, áreas densas del espacio de datos, intervalos o distribuciones estadísticas particulares. En consecuencia, la agrupación puede formularse como un problema de optimización multiobjetivo, y el algoritmo y los parámetros apropiados (como la función de distancia, el umbral de densidad o el número esperado de conglomerados) dependen del conjunto de datos individual y del uso previsto de los resultados. El análisis de conglomerados no es una tarea automática, sino un proceso iterativo de descubrimiento de conocimiento o de optimización interactiva multiobjetivo, que a menudo requiere prueba y error para ajustar el preprocesamiento de datos y los parámetros del modelo hasta que el resultado logre las propiedades deseadas.
Además del término agrupación, existen varios términos similares, como clasificación automática, taxonomía numérica, botriología (del griego βότρυς 'uva'), análisis tipológico y detección de comunidades. Las diferencias sutiles a menudo residen en el uso de los resultados: en la minería de datos, los grupos resultantes son el tema de interés, mientras que en la clasificación automática, el poder discriminativo resultante es el interés.
Historia
El análisis de conglomerados se originó en la antropología con el trabajo de Driver y Kroeber en 1932. Fue introducido en la psicología por Joseph Zubin en 1938 y Robert Tryon en 1939, y fue famosamente utilizado por Raymond Cattell a partir de 1943 para la clasificación de rasgos en la psicología de la personalidad. Desde entonces, la agrupación ha evolucionado hasta convertirse en una herramienta fundamental en numerosas disciplinas científicas, con cientos de algoritmos publicados desarrollados a lo largo de las décadas.
Modelos de Conglomerados
La noción de "conglomerado" no puede definirse con precisión, lo cual es una razón clave para la diversidad de algoritmos de agrupación. Hay un denominador común: un grupo de objetos de datos. Sin embargo, diferentes investigadores emplean diferentes modelos de conglomerados, y cada modelo puede ser implementado por varios algoritmos. Comprender estos modelos de conglomerados es esencial para entender las diferencias entre los algoritmos. Los modelos típicos de conglomerados incluyen:
- Modelos de conectividad: La agrupación jerárquica construye modelos basados en la conectividad de distancia, donde los conglomerados se forman enlazando objetos según su proximidad.
- Modelos de centroide: El algoritmo k-means representa cada conglomerado mediante un único vector medio, o centroide, y asigna objetos al centroide más cercano.
- Modelos de distribución: Los conglomerados se modelan utilizando distribuciones estadísticas, como las distribuciones normales multivariantes utilizadas por el algoritmo de maximización de expectativas (EM).
- Modelos de densidad: Algoritmos como DBSCAN, OPTICS y HDBSCAN definen conglomerados como regiones densas conectadas en el espacio de datos, separadas por áreas dispersas.
- Modelos de subespacio: En el biclustering (también conocido como co-clustering o agrupación de dos modos), los conglomerados se modelan con miembros del conglomerado y atributos relevantes, lo que permite que los conglomerados existan en diferentes subespacios de los datos.
- Modelos de grupo: Algunos algoritmos no proporcionan un modelo refinado para sus resultados y simplemente ofrecen la información de agrupación.
- Modelos basados en grafos: Una camarilla, un subconjunto de nodos en un grafo donde cada dos nodos están conectados por una arista, puede considerarse una forma prototípica de conglomerado. Las relajaciones del requisito de conectividad completa, conocidas como cuasicamarillas, se utilizan en algoritmos como el algoritmo de agrupación HCS.
- Modelos de grafos con signos: En los grafos con signos, cada camino tiene un signo que es el producto de los signos en las aristas. Bajo los supuestos de la teoría del equilibrio, las aristas pueden cambiar de signo, lo que resulta en un grafo bifurcado. El "axioma de agrupabilidad" más débil (ningún ciclo tiene exactamente una arista negativa) produce resultados con más de dos conglomerados o subgrafos con solo aristas positivas.
- Modelos neuronales: La red neuronal no supervisada más conocida es el mapa autoorganizativo, y estos modelos generalmente pueden caracterizarse como similares a uno o más de los modelos anteriores, incluidos los modelos de subespacio cuando las redes neuronales implementan formas de análisis de componentes principales o análisis de componentes independientes.
Tipos de Agrupación
Una "agrupación" es esencialmente un conjunto de conglomerados, que generalmente contiene todos los objetos del conjunto de datos. También puede especificar la relación de los conglomerados entre sí, como una jerarquía de conglomerados anidados entre sí. Las agrupaciones pueden distinguirse aproximadamente como:
- Agrupación dura: Cada objeto pertenece a un conglomerado o no.
- Agrupación suave (también agrupación difusa): Cada objeto pertenece a cada conglomerado en cierto grado, como una probabilidad de pertenencia.
Las distinciones más finas incluyen:
- Agrupación de partición estricta: Cada objeto pertenece exactamente a un conglomerado.
- Agrupación de partición estricta con valores atípicos: Los objetos también pueden no pertenecer a ningún conglomerado, en cuyo caso se consideran valores atípicos.
- Agrupación superpuesta (también agrupación alternativa, agrupación multivista): Los objetos pueden pertenecer a más de un conglomerado, generalmente involucrando conglomerados duros.
- Agrupación jerárquica: Los objetos que pertenecen a un conglomerado hijo también pertenecen al conglomerado padre, creando una estructura de árbol.
- Agrupación de subespacio: Aunque es una agrupación superpuesta, dentro de un subespacio definido de manera única, no se espera que los conglomerados se superpongan.
Algoritmos
Los algoritmos de agrupación pueden categorizarse según su modelo de conglomerado. Posiblemente hay más de 100 algoritmos de agrupación publicados, y no todos proporcionan modelos para sus conglomerados, lo que dificulta la categorización. No existe un algoritmo de agrupación objetivamente "correcto"; como se ha señalado, "la agrupación está en el ojo del observador". De hecho, un enfoque axiomático demuestra que es imposible que cualquier método de agrupación cumpla simultáneamente tres propiedades fundamentales: invariancia de escala (los resultados permanecen sin cambios bajo un escalado proporcional de las distancias), riqueza (todas las particiones posibles de los datos pueden lograrse) y consistencia entre las distancias y la estructura de agrupación. El algoritmo más apropiado para un problema particular a menudo debe elegirse experimentalmente, a menos que haya una razón matemática para preferir un modelo de conglomerado sobre otro.
Los algoritmos de agrupación prominentes incluyen:
- K-means: Un algoritmo basado en centroides que divide los datos en k conglomerados minimizando la suma de cuadrados dentro del conglomerado. Es simple y eficiente, pero requiere especificar el número de conglomerados y es sensible a los valores atípicos.
- Agrupación jerárquica: Construye una jerarquía de conglomerados de manera aglomerativa (de abajo hacia arriba) o divisiva (de arriba hacia abajo). No requiere un número predefinido de conglomerados y produce un dendrograma.
- DBSCAN: Un algoritmo basado en densidad que identifica conglomerados como regiones densas separadas por áreas dispersas. Puede encontrar conglomerados de formas arbitrarias y manejar valores atípicos, pero requiere ajustar parámetros como épsilon y puntos mínimos.
- Maximización de Expectativas (EM): Un algoritmo basado en distribuciones que modela conglomerados como distribuciones gaussianas e itera para estimar parámetros que maximicen la verosimilitud.
- OPTICS: Una extensión de DBSCAN que produce un ordenamiento de conglomerados, lo que lo hace más robusto a densidades variables.
- Mapas autoorganizativos (SOM): Un modelo de red neuronal que mapea datos de alta dimensión a una cuadrícula de baja dimensión, preservando las relaciones topológicas.
Aplicaciones
La agrupación se utiliza ampliamente en muchos dominios. En el reconocimiento de patrones, ayuda a identificar grupos en datos para tareas de clasificación. En el análisis de imágenes, se utiliza para la segmentación de imágenes y la detección de objetos. En la recuperación de información, la agrupación organiza documentos por tema para búsqueda y recomendación. En bioinformática, agrupa genes o proteínas con patrones de expresión similares. En la compresión de datos, la agrupación reduce el tamaño de los datos representando grupos con prototipos. En los gráficos por computadora, ayuda en la cuantización de color y la simplificación de mallas. En la inteligencia artificial, la agrupación es una técnica central para el aprendizaje no supervisado, permitiendo que los sistemas descubran patrones sin ejemplos etiquetados.
Desafíos y Consideraciones
La agrupación presenta varios desafíos. Determinar el número óptimo de conglomerados a menudo es difícil y puede requerir conocimiento del dominio o heurísticas. La elección de la métrica de distancia afecta significativamente los resultados; las métricas comunes incluyen la euclidiana, la de Manhattan y la similitud del coseno. Los datos de alta dimensión pueden sufrir la maldición de la dimensionalidad, donde las distancias se vuelven menos significativas. Los resultados de la agrupación son sensibles a la inicialización y a los ajustes de parámetros, y no existe una solución universal. Además, la naturaleza iterativa de la agrupación significa que los resultados deben validarse utilizando métricas de evaluación internas o externas, como el coeficiente de silueta o el índice de Rand, para asegurar que cumplan con las propiedades deseadas.
Conceptos Relacionados
La agrupación está estrechamente relacionada con otras técnicas de aprendizaje no supervisado, como la reducción de dimensionalidad y la detección de anomalías. A menudo se utiliza junto con la aumento de datos para generar muestras sintéticas o en el preprocesamiento para el aprendizaje supervisado. En el contexto del aprendizaje profundo, la agrupación puede integrarse en arquitecturas de redes neuronales para el aprendizaje de representaciones. Los principios de la agrupación también sustentan la detección de comunidades en el análisis de redes y la segmentación de mercado en la analítica empresarial.