Análisis de conglomerados

Mapa conceptual
- EDA
- Univariante
- Histogramas
- Boxplots
- Atipicos
- Bivariante
- Scatter
- Correlacion
- Confusion
- Multivariante
- Pairs plot
- Parallel coord
- Modelo
- Hipotesis
- Seleccion
- Univariante
Aprendizaje no supervisado
A diferencia de la clasificación, aquí no hay etiquetas que aprender: no sabemos cuántos grupos hay ni cuáles son. El objetivo es descubrir estructura latente, particionar los datos de forma que los miembros de un grupo se parezcan entre sí más que a los de otros.
Todo depende de la distancia
Agrupar exige definir «cerca». La distancia euclídea vale para variables continuas comparables; pero mezclar escalas o tipos la distorsiona. La elección de métrica de distancia puede cambiar por completo la partición resultante, así que debe meditarse.
Estandarizar antes de agrupar
Como el clustering se basa en distancias, una variable con rango enorme dominará el cálculo y aplastará a las demás. Tipificar todas las variables a escala comparable es casi siempre un paso obligatorio antes de agrupar.
K-medias
El algoritmo de k-medias asigna cada punto al centroide más cercano y recoloca los centroides al promedio de sus asignados, iterando hasta estabilizar. Rápido y popular, busca minimizar la dispersión dentro de cada grupo.
Los problemas de k-medias
- Hay que fijar el número de grupos k de antemano, sin saberlo.
- Asume grupos esféricos y de tamaño parecido: falla con formas raras.
- Sensible a inicialización y a outliers; distintos arranques dan distintas soluciones.
- Trabaja con medias, inútil para datos categóricos.
Elegir k
El método del codo grafica la dispersión interna contra k y busca el punto donde dejar de añadir grupos aporta poco. El coeficiente de silueta evalúa cuán bien separado está cada punto de su grupo frente al vecino, dando una medida de calidad según k.
Jerárquico
El clustering jerárquico no fija k: construye una torre de fusiones (aglomerativo, de abajo arriba) o divisiones (divisivo) que se corta a la altura deseada. El dendrograma resultante muestra relaciones de anidamiento entre grupos y deja elegir la granularidad a posteriori.
Enlaces y su efecto
Al fusionar grupos, el «enlace» decide la distancia entre dos cúmulos: mínimo (cadena), máximo, o promedio (UPGMA). El enlace mínimo tiende a encadenar puntos y produce grupos alargados; el promedio suele dar particiones más compactas y equilibradas.
DBSCAN y formas arbitrarias
Los métodos basados en densidad como DBSCAN descubren grupos de forma arbitraria y no requieren fijar k: agrupan zonas densas y marcan como ruido los puntos aislados. Excelente para formas no esféricas y detección de outliers, aunque sensible a sus parámetros de radio y densidad mínima.
Validar sin verdad
Sin etiquetas de referencia, evaluar un clustering es esquivo. Los índices internos (silueta, inercia) miden cohesión y separación; pero un buen número no prueba que los grupos signifiquen algo. La validación final es sustantiva: ¿los grupos se entienden y sirven?
Estabilidad
Un agrupamiento robusto apenas cambia al perturbar ligeramente los datos o al reejecutar con otra inicialización. Si cada corrida da una partición distinta, los «grupos» son artefactos del algoritmo, no estructura real. Probar la estabilidad es esencial.
Interpretar los grupos
Agrupar solo separa; el analista debe mirar cómo difieren los grupos en cada variable para ponerles nombre y sentido. Un segmento sin característica que lo distinga es un grupo vacío de significado, aunque matemáticamente compacto.
Errores frecuentes
- Agrupar variables de escalas incomparables sin tipificar, dejando que una mande.
- Atribuir a los grupos un significado causal o real que el algoritmo jamás pudo conocer.
- Fijar k por estética y luego celebrar grupos que no se sostienen al re-muestrear.
La principal desventaja de k-medias frente a un método por densidad como DBSCAN es que k-medias:
Un dendrograma permite elegir el número de grupos después de construir la jerarquía, cortándolo a distintas alturas.
Clusters para negocio
Segmentar clientes, agrupar documentos, detectar patrones de fraude: el clustering convierte una masa heterogénea en perfiles manejables. Su valor no está en la elegancia matemática sino en habilitar acciones diferenciadas por grupo.
Preprocesado compartido
Reducción dimensional antes de agrupar (por PCA) puede limpiar las distancias y quitar ruido, revelando estructura oculta en el espacio original. Cluster y reducción son aliados frecuentes en la exploración multivariante.
Conglomerados
Toca una tarjeta para ver la respuesta.
Ordena un proyecto de clustering riguroso:
Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.
Agrupas clientes y obtienes cuatro segmentos compactos pero indistinguibles entre sí en las variables de negocio. ¿Sirve de algo ese clustering y qué revisarías?
Tu texto se guarda sólo en este dispositivo.
Comentarios
Inicia sesión para comentar.
Todavía no hay comentarios. Sé la primera persona en opinar.