PCA: por qué es álgebra lineal disfrazada
Buscar las direcciones donde los datos más varían es exactamente calcular autovectores de la matriz de covarianza. Es el mismo tema de álgebra lineal, con otro nombre y una aplicación concreta.
Para este tema conviene tener claro:Direcciones que no rotan: autovalores y autovectores
Con cincuenta columnas no se puede graficar nada, muchas están correlacionadas y varias son casi ruido. El análisis de componentes principales resuelve las tres cosas a la vez, y lo que hace por debajo es un cálculo que ya aparece en álgebra lineal.
Buscar los ejes donde los datos se dispersan
La idea es encontrar un nuevo sistema de ejes. El primer eje es la dirección en la que los datos más se dispersan; el segundo, la dirección de máxima dispersión entre las perpendiculares al primero, y así.
Esas direcciones son las componentes principales. Proyectando los datos sobre las primeras se conserva la mayor parte de la variación con muchas menos dimensiones. No se eligen columnas originales: se arman combinaciones de todas.
Antes de seguir, predecí
Autovectores de la covarianza
Formalmente, esas direcciones son los autovectores de la matriz de covarianza, y sus autovalores dicen cuánta varianza explica cada una.
Ahí está la conexión: buscar la dirección de máxima varianza es un problema de optimización cuya solución es el autovector de mayor autovalor. El álgebra lineal no es una herramienta auxiliar acá, es literalmente el contenido. En la práctica se computa por descomposición en valores singulares, que es más estable numéricamente que formar la covarianza.
Cuántas componentes conservar
Cuántas componentes conservar se decide con los autovalores: se grafican en orden decreciente y se busca el codo, o se acumula hasta cubrir un porcentaje de la varianza —80%, 95%, según el uso—.
Ocho variables correlacionadas entre sí. Los autovalores, ordenados de mayor a menor, dicen cuánta varianza toma cada dirección.
Hay dos pasos previos que no son negociables. Centrar los datos, porque la primera componente sin centrar apunta al promedio y no a la variación. Y estandarizar cuando las unidades son distintas: sin eso, la variable medida en números grandes se lleva toda la varianza y la primera componente termina siendo esa variable.
Visualizar, comprimir y quitar correlación
Sirve para varias cosas distintas. Visualizar: proyectar a dos componentes y ver la estructura. Comprimir: guardar menos números con pérdida controlada. Quitar ruido, suponiendo que el ruido vive en las direcciones de poca varianza.
Y resolver la multicolinealidad: las componentes son ortogonales entre sí por construcción, así que alimentar un modelo con ellas elimina la correlación entre predictores. También acelera algoritmos que sufren la alta dimensión, como vecinos cercanos.
Sus supuestos y lo que no captura
Sus supuestos limitan. Es lineal: si la estructura es una espiral o una curva, no la captura, y para eso están las variantes con núcleo o métodos no lineales como t-SNE y UMAP —que sirven para ver, no para transformar datos nuevos—.
Supone además que varianza equivale a información, y no siempre es cierto: la variable más discriminante para una clasificación puede tener poca varianza y quedar descartada. Para separar clases, el análisis discriminante lineal apunta a eso directamente. Y las componentes pierden interpretabilidad: “0.3 por ingreso menos 0.5 por edad” no es algo que se explique en una reunión.
Dos cuidados que evitan medir de más
Dos cuidados prácticos. Ajustar la transformación sólo con los datos de entrenamiento y aplicarla al resto: calcular las componentes sobre todo el conjunto es una fuga de datos como cualquier otra.
Y no usarlo por reflejo. Reducir dimensión antes de un modelo que maneja bien muchos atributos —un ensamble de árboles, por ejemplo— suele perder información sin ganar nada. Conviene cuando la alta dimensión es efectivamente el problema.
Cuándo reducir dimensiones y cuándo no
| Para | ¿Sirve PCA? | Alternativa |
|---|---|---|
| Visualizar en dos dimensiones | sí, y conserva la estructura global | t-SNE o UMAP si importa lo local |
| Acelerar un modelo | sí | seleccionar atributos, que además se interpreta |
| Quitar ruido | sí, si el ruido está en las direcciones de poca varianza | depende del dominio |
| Quitar la correlación entre predictores | sí, por construcción | ridge, que no cambia las variables |
| Interpretar qué atributos importan | no | las componentes son combinaciones de todo |
Cierre
Las componentes principales son los autovectores de la covarianza y sus autovalores, la varianza explicada. Centrar y estandarizar antes; sirve para visualizar, comprimir y descorrelacionar. Es lineal, supone que varianza es información y las componentes no se interpretan.
Autoevaluación
¿Lo entendiste?
Práctica