← Lumbre

Estadística Multivariada · 4.º Análisis de conglomerados

← Volver a todos los contenidos
Portada de Análisis de conglomerados

Análisis de conglomerados

✦ No todo grupo existe de antemano: a veces hay que descubrirlo · Estadística Multivariada · Probabilidad y Estadística · 9 minutos que valen la pena

Roadwise Consulting

Firmado y verificado · Fernando Castro

Objetivo: Agrupar observaciones según su semejanza con métodos jerárquicos y de centroides, elegir distancias y validar que los grupos tienen sentido.

9 min 18–30 años
Autoevaluación
Más
Análisis de conglomerados

Herramientas de la lección

◉ Entrar a La Matrix Sorpréndeme

Sobre este contenido

Ir a

Volver a Objetos Cursos Explorar Mi cuenta Salir del modo estudio

Análisis de conglomerados

Diagrama de estadistica multivariada: ejes PCA en 3D, elipse de covarianza y clusters.
Estadistica multivariada: PCA, covarianza y tecnicas de reduccion de dimension.

Mapa conceptual

  • EDA
    • Univariante
      • Histogramas
      • Boxplots
      • Atipicos
    • Bivariante
      • Scatter
      • Correlacion
      • Confusion
    • Multivariante
      • Pairs plot
      • Parallel coord
    • Modelo
      • Hipotesis
      • Seleccion

Aprendizaje no supervisado

A diferencia de la clasificación, aquí no hay etiquetas que aprender: no sabemos cuántos grupos hay ni cuáles son. El objetivo es descubrir estructura latente, particionar los datos de forma que los miembros de un grupo se parezcan entre sí más que a los de otros.

Todo depende de la distancia

Agrupar exige definir «cerca». La distancia euclídea vale para variables continuas comparables; pero mezclar escalas o tipos la distorsiona. La elección de métrica de distancia puede cambiar por completo la partición resultante, así que debe meditarse.

Estandarizar antes de agrupar

Como el clustering se basa en distancias, una variable con rango enorme dominará el cálculo y aplastará a las demás. Tipificar todas las variables a escala comparable es casi siempre un paso obligatorio antes de agrupar.

K-medias

El algoritmo de k-medias asigna cada punto al centroide más cercano y recoloca los centroides al promedio de sus asignados, iterando hasta estabilizar. Rápido y popular, busca minimizar la dispersión dentro de cada grupo.

Los problemas de k-medias

  • Hay que fijar el número de grupos k de antemano, sin saberlo.
  • Asume grupos esféricos y de tamaño parecido: falla con formas raras.
  • Sensible a inicialización y a outliers; distintos arranques dan distintas soluciones.
  • Trabaja con medias, inútil para datos categóricos.

Elegir k

El método del codo grafica la dispersión interna contra k y busca el punto donde dejar de añadir grupos aporta poco. El coeficiente de silueta evalúa cuán bien separado está cada punto de su grupo frente al vecino, dando una medida de calidad según k.

Jerárquico

El clustering jerárquico no fija k: construye una torre de fusiones (aglomerativo, de abajo arriba) o divisiones (divisivo) que se corta a la altura deseada. El dendrograma resultante muestra relaciones de anidamiento entre grupos y deja elegir la granularidad a posteriori.

Enlaces y su efecto

Al fusionar grupos, el «enlace» decide la distancia entre dos cúmulos: mínimo (cadena), máximo, o promedio (UPGMA). El enlace mínimo tiende a encadenar puntos y produce grupos alargados; el promedio suele dar particiones más compactas y equilibradas.

DBSCAN y formas arbitrarias

Los métodos basados en densidad como DBSCAN descubren grupos de forma arbitraria y no requieren fijar k: agrupan zonas densas y marcan como ruido los puntos aislados. Excelente para formas no esféricas y detección de outliers, aunque sensible a sus parámetros de radio y densidad mínima.

Validar sin verdad

Sin etiquetas de referencia, evaluar un clustering es esquivo. Los índices internos (silueta, inercia) miden cohesión y separación; pero un buen número no prueba que los grupos signifiquen algo. La validación final es sustantiva: ¿los grupos se entienden y sirven?

Estabilidad

Un agrupamiento robusto apenas cambia al perturbar ligeramente los datos o al reejecutar con otra inicialización. Si cada corrida da una partición distinta, los «grupos» son artefactos del algoritmo, no estructura real. Probar la estabilidad es esencial.

Interpretar los grupos

Agrupar solo separa; el analista debe mirar cómo difieren los grupos en cada variable para ponerles nombre y sentido. Un segmento sin característica que lo distinga es un grupo vacío de significado, aunque matemáticamente compacto.

Errores frecuentes

  • Agrupar variables de escalas incomparables sin tipificar, dejando que una mande.
  • Atribuir a los grupos un significado causal o real que el algoritmo jamás pudo conocer.
  • Fijar k por estética y luego celebrar grupos que no se sostienen al re-muestrear.

La principal desventaja de k-medias frente a un método por densidad como DBSCAN es que k-medias:

Un dendrograma permite elegir el número de grupos después de construir la jerarquía, cortándolo a distintas alturas.

Clusters para negocio

Segmentar clientes, agrupar documentos, detectar patrones de fraude: el clustering convierte una masa heterogénea en perfiles manejables. Su valor no está en la elegancia matemática sino en habilitar acciones diferenciadas por grupo.

Preprocesado compartido

Reducción dimensional antes de agrupar (por PCA) puede limpiar las distancias y quitar ruido, revelando estructura oculta en el espacio original. Cluster y reducción son aliados frecuentes en la exploración multivariante.

Conglomerados

Minimiza la dispersión alrededor de centroides
k-medias
Torre de fusiones con corte a posteriori
jerarquico
Encuentra formas arbitrarias y ruido
dbscan
Mide cohesión y separación sin etiquetas
silueta
Mide cercanía entre dos cúmulos
enlace

Toca una tarjeta para ver la respuesta.

Ordena un proyecto de clustering riguroso:

Arrastra cada ficha a su categoría (o tócala y luego toca la categoría). También puedes usar el teclado.

Video complementario
Recurso audiovisual para reforzar los conceptos.

Agrupas clientes y obtienes cuatro segmentos compactos pero indistinguibles entre sí en las variables de negocio. ¿Sirve de algo ese clustering y qué revisarías?

Tu texto se guarda sólo en este dispositivo.

Las respuestas y tu progreso se guardan sólo en este dispositivo. Contenido firmado por su autoría mediante Lumbre.

Autoevaluación

Comprueba lo que aprendiste

2 preguntas · ves cada respuesta al momento · el resultado queda guardado en tu historial

Iniciar autoevaluación
Más sobre esta lección

¿Necesitas ayuda?

Vamos a atacar justo la parte que no te cuadra

Explicaciones cortas, dibujos, ejemplos y práctica. Nada cuenta como nota.

Rutas vivas

¿Y ahora qué? Elige el camino por lo que necesitas

No es un listado al azar: cada camino responde una pregunta distinta y te dice por qué.

Otra forma de comprenderlo

✦ Explorar el universo completo
Explora temas relacionados

Conceptos

Comentarios

Inicia sesión para comentar.

Todavía no hay comentarios. Sé la primera persona en opinar.