Atlasingeniería

Aprendizaje automáticoNo supervisado y reducción de dimensiónTema 2

PCA: por qué es álgebra lineal disfrazada

Buscar las direcciones donde los datos más varían es exactamente calcular autovectores de la matriz de covarianza. Es el mismo tema de álgebra lineal, con otro nombre y una aplicación concreta.

Para este tema conviene tener claro:Direcciones que no rotan: autovalores y autovectores

Con cincuenta columnas no se puede graficar nada, muchas están correlacionadas y varias son casi ruido. El análisis de componentes principales resuelve las tres cosas a la vez, y lo que hace por debajo es un cálculo que ya aparece en álgebra lineal.

Buscar los ejes donde los datos se dispersan

La idea es encontrar un nuevo sistema de ejes. El primer eje es la dirección en la que los datos más se dispersan; el segundo, la dirección de máxima dispersión entre las perpendiculares al primero, y así.

Esas direcciones son las componentes principales. Proyectando los datos sobre las primeras se conserva la mayor parte de la variación con muchas menos dimensiones. No se eligen columnas originales: se arman combinaciones de todas.

Antes de seguir, predecí

Aplicás PCA sobre datos con sueldos en pesos y edades en años, sin estandarizar. ¿Qué pasa?

Autovectores de la covarianza

Formalmente, esas direcciones son los autovectores de la matriz de covarianza, y sus autovalores dicen cuánta varianza explica cada una.

Ahí está la conexión: buscar la dirección de máxima varianza es un problema de optimización cuya solución es el autovector de mayor autovalor. El álgebra lineal no es una herramienta auxiliar acá, es literalmente el contenido. En la práctica se computa por descomposición en valores singulares, que es más estable numéricamente que formar la covarianza.

Cuántas componentes conservar

Cuántas componentes conservar se decide con los autovalores: se grafican en orden decreciente y se busca el codo, o se acumula hasta cubrir un porcentaje de la varianza —80%, 95%, según el uso—.

Ocho variables correlacionadas entre sí. Los autovalores, ordenados de mayor a menor, dicen cuánta varianza toma cada dirección.

1 / 5
Ocho variables originales, y con tres componentes ya hay 88% de la variación. El codo está entre la tercera y la cuarta: a partir de ahí, cada componente que se suma aporta casi lo mismo que la siguiente, que es la señal de que lo que queda es ruido repartido.

Hay dos pasos previos que no son negociables. Centrar los datos, porque la primera componente sin centrar apunta al promedio y no a la variación. Y estandarizar cuando las unidades son distintas: sin eso, la variable medida en números grandes se lleva toda la varianza y la primera componente termina siendo esa variable.

Visualizar, comprimir y quitar correlación

Sirve para varias cosas distintas. Visualizar: proyectar a dos componentes y ver la estructura. Comprimir: guardar menos números con pérdida controlada. Quitar ruido, suponiendo que el ruido vive en las direcciones de poca varianza.

Y resolver la multicolinealidad: las componentes son ortogonales entre sí por construcción, así que alimentar un modelo con ellas elimina la correlación entre predictores. También acelera algoritmos que sufren la alta dimensión, como vecinos cercanos.

Sus supuestos y lo que no captura

Sus supuestos limitan. Es lineal: si la estructura es una espiral o una curva, no la captura, y para eso están las variantes con núcleo o métodos no lineales como t-SNE y UMAP —que sirven para ver, no para transformar datos nuevos—.

Supone además que varianza equivale a información, y no siempre es cierto: la variable más discriminante para una clasificación puede tener poca varianza y quedar descartada. Para separar clases, el análisis discriminante lineal apunta a eso directamente. Y las componentes pierden interpretabilidad: “0.3 por ingreso menos 0.5 por edad” no es algo que se explique en una reunión.

Dos cuidados que evitan medir de más

Dos cuidados prácticos. Ajustar la transformación sólo con los datos de entrenamiento y aplicarla al resto: calcular las componentes sobre todo el conjunto es una fuga de datos como cualquier otra.

Y no usarlo por reflejo. Reducir dimensión antes de un modelo que maneja bien muchos atributos —un ensamble de árboles, por ejemplo— suele perder información sin ganar nada. Conviene cuando la alta dimensión es efectivamente el problema.

Cuándo reducir dimensiones y cuándo no

Para¿Sirve PCA?Alternativa
Visualizar en dos dimensionessí, y conserva la estructura globalt-SNE o UMAP si importa lo local
Acelerar un modeloseleccionar atributos, que además se interpreta
Quitar ruidosí, si el ruido está en las direcciones de poca varianzadepende del dominio
Quitar la correlación entre predictoressí, por construcciónridge, que no cambia las variables
Interpretar qué atributos importannolas componentes son combinaciones de todo
La última fila es la contra principal: después de PCA, «la componente 1» es una mezcla de las cuarenta variables originales y no se le puede explicar a nadie.

Cierre

Las componentes principales son los autovectores de la covarianza y sus autovalores, la varianza explicada. Centrar y estandarizar antes; sirve para visualizar, comprimir y descorrelacionar. Es lineal, supone que varianza es información y las componentes no se interpretan.

Autoevaluación

¿Lo entendiste?

¿Qué son las componentes principales, formalmente?
Al aplicar PCA, ¿qué se obtiene?
¿Por qué hay que estandarizar antes de aplicar PCA?
¿Cómo se decide cuántas componentes conservar?