Clustering: k-means y jerárquico
Agrupar sin etiquetas parece objetivo y no lo es: cada algoritmo trae su propia definición de qué es un grupo, y los datos casi siempre se dejan partir aunque no haya grupos reales.
Para este tema conviene tener claro:Qué significa que un modelo aprenda
Pedirle a un algoritmo que encuentre grupos en los datos suena a descubrimiento neutral. No lo es: todo algoritmo de clustering impone una idea de qué forma tiene un grupo, y siempre devuelve una partición, haya estructura real o no.
K-means, en dos pasos que se repiten
K-means es el más usado y su mecánica cabe en dos pasos que se repiten: asignar cada punto al centro más cercano, y recalcular cada centro como el promedio de sus puntos.
Los datos: dos grupos claros, a la izquierda y a la derecha. El punto es que el algoritmo no los ve así.
Converge rápido y siempre, aunque a un óptimo local: el resultado depende de dónde arrancaron los centros, y por eso se corre varias veces con inicializaciones distintas. La inicialización k-means++ elige los centros iniciales bien separados y mejora bastante la consistencia.
Antes de seguir, predecí
Lo que k-means supone sin decirlo
Lo que k-means supone es fuerte y conviene tenerlo explícito: grupos esféricos, de tamaño parecido y de densidad similar, porque minimizar la distancia al centro no puede representar otra cosa.
Con grupos alargados, anidados o de tamaños muy distintos, parte mal. También exige elegir de antemano y escalar los atributos, porque trabaja con distancias. Y los valores atípicos corren los centros, porque el promedio no es robusto.
Elegir k: heurísticas, no respuestas
Para elegir hay heurísticas, no respuestas. El método del codo grafica la inercia contra y busca el quiebre, que muchas veces no existe con claridad. El coeficiente de silueta mide qué tan bien separado está cada punto de los grupos vecinos y da un número comparable.
La decisión honesta suele ser distinta: elegir el que resulte accionable. Si los grupos se van a usar para armar cinco campañas, hay cinco grupos; la matemática no va a resolver una pregunta que es de negocio.
El jerárquico, que no pide k
El clustering jerárquico no pide . En su versión aglomerativa, arranca con cada punto como grupo y va fusionando los dos más cercanos hasta quedarse con uno solo, produciendo un árbol.
Ese dendrograma se corta a la altura que se quiera, y eso permite mirar la estructura antes de decidir cuántos grupos hay. Lo que hay que definir es cómo medir la distancia entre grupos: enlace simple —que forma cadenas alargadas—, completo —que tiende a grupos compactos—, o promedio. El costo es cuadrático o peor, así que no escala a conjuntos grandes.
DBSCAN: un grupo es una región densa
DBSCAN parte de otra definición: un grupo es una región densa. Los puntos con suficientes vecinos cerca forman núcleos que se encadenan, y los que quedan en zonas ralas se marcan como ruido.
Eso le da tres ventajas concretas: encuentra grupos de forma arbitraria, no necesita y detecta atípicos en vez de forzarlos adentro. A cambio, hay que elegir el radio y el mínimo de vecinos, y funciona mal cuando los grupos tienen densidades muy distintas.
Evaluar sin etiquetas, el problema difícil
Evaluar sin etiquetas es el problema difícil. Las métricas internas —silueta, índices de separación— miden coherencia geométrica, que no es lo mismo que utilidad.
La validación que sirve es externa: ¿los grupos se distinguen en variables que no se usaron para armarlos? ¿Alguien que conoce el dominio los reconoce? ¿Se mantienen si se reparte la muestra en dos? Sin alguna de esas respuestas, un clustering es una partición bonita sin evidencia de que signifique algo.
Qué algoritmo para qué forma
| k-means | DBSCAN | Jerárquico | Mezcla de gaussianas | |
|---|---|---|---|---|
| Hay que elegir k | sí | no | no: se corta el árbol | sí |
| Forma de los grupos | esférica | cualquiera | cualquiera | elíptica |
| Atípicos | los mete en un grupo | los deja afuera | los mete | los mete |
| Escala | muy bien | mediana | mal: O(n²) | bien |
| Pertenencia | dura | dura | dura | blanda: probabilidad por grupo |
Cierre
K-means es rápido y supone grupos esféricos de tamaño similar, con fijado de antemano y sensibilidad a la inicialización y a los atípicos. El jerárquico muestra la estructura en un árbol y no escala; DBSCAN agrupa por densidad y marca ruido. Y la validación real es externa, no geométrica.
Autoevaluación
¿Lo entendiste?
Práctica