Atlasingeniería

Aprendizaje automáticoAprendizaje supervisadoTema 4

Máquinas de soporte vectorial y el truco del núcleo

Separar con el margen más ancho posible, y cuando los datos no son separables, mirarlos en un espacio de más dimensiones sin llegar a construirlo nunca.

Para este tema conviene tener claro:Producto interno, norma y distancia

Si dos clases se pueden separar con una recta, hay infinitas rectas que lo logran. Las máquinas de soporte vectorial eligen una en particular —la que deja el pasillo más ancho entre las clases— y esa elección tiene una justificación que se traduce en mejor generalización.

El margen, y por qué maximizarlo

El margen es la distancia del hiperplano al punto más cercano de cada clase. Maximizarlo da la frontera más “segura”: la que tolera más ruido antes de equivocarse.

La solución depende únicamente de los puntos que quedan sobre el borde del pasillo. Esos son los vectores de soporte, y son pocos. Todos los demás puntos podrían moverse sin cambiar nada, lo que hace al modelo compacto y robusto frente a datos lejanos a la frontera.

Antes de seguir, predecí

Datos que no se pueden separar con una recta. ¿Qué hace el truco del núcleo?

El margen blando y el parámetro que lo regula

Los datos reales casi nunca son perfectamente separables, y exigir margen duro con un solo punto mal ubicado arruina la solución. El margen blando permite violaciones, penalizadas en el costo.

El parámetro CC regula ese balance: alto, prioriza clasificar bien el entrenamiento y achica el margen; bajo, tolera errores y ensancha. Es el hiperparámetro principal y equivale a una regularización.

El truco: productos internos sin construir coordenadas

Para datos que no separa ninguna recta, la idea es llevarlos a un espacio de más dimensiones donde sí haya un hiperplano que los separe. Dos círculos concéntricos en el plano se separan con una superficie plana si se agrega una tercera dimensión con la distancia al centro.

Imaginá los datos sobre el eje horizontal: una clase cerca del cero y la otra en los dos extremos. Ningún punto de corte los separa. Ahora mirá dónde los pone la curva: los del centro quedan abajo y los de los extremos arriba, y ahí sí alcanza con una línea horizontal. Eso es todo el levantamiento, y el truco del núcleo es hacerlo sin llegar a dibujar la segunda coordenada.f(x) = x ^ 2

El problema es que ese espacio puede ser enorme o infinito. El truco del núcleo lo esquiva: la solución sólo necesita productos internos entre pares de puntos, y una función núcleo los calcula directamente en el espacio original, sin construir las coordenadas transformadas.

Los núcleos habituales, que son pocos

Los núcleos habituales son pocos. El lineal, que es no transformar. El polinomial, que representa interacciones de cierto grado. Y el gaussiano o RBF, el más usado, que corresponde a un espacio de dimensión infinita y mide similitud por cercanía.

En RBF, el parámetro gamma controla cuán local es la influencia de cada punto: alto, fronteras muy sinuosas que sobreajustan; bajo, fronteras casi lineales. Junto con CC forman el par que hay que buscar por validación.

El costo es el límite práctico

El costo es el límite práctico. Entrenar requiere trabajar con una matriz de similitudes entre todos los pares, así que escala mal: entre cuadrático y cúbico en la cantidad de ejemplos. Con cientos de miles de filas deja de ser viable.

Además necesita atributos escalados, porque las distancias mandan, y no produce probabilidades naturales: hay que estimarlas con un paso extra. Frente a datos tabulares grandes, un ensamble de árboles casi siempre es mejor opción.

Dónde sigue siendo fuerte

Donde sigue siendo fuerte es en conjuntos medianos con muchos atributos y pocas filas, que es exactamente el caso de bioinformática o clasificación de texto: ahí la maximización del margen controla bien el sobreajuste.

Y el truco del núcleo excede a las SVM: es una idea reutilizable. Cualquier algoritmo que dependa sólo de productos internos —PCA, regresión, detección de anomalías— admite su versión con núcleo. Esa generalidad es la parte que más rinde recordar.

Dónde queda hoy

SVM con núcleoBoostingRed neuronal
Pocos datos, muchas dimensionesmuy buenorazonablemalo
Cien mil filas o másmalo: escala malbuenobueno
Probabilidadesno naturalmentecon calibracióncon calibración
Interpretabilidadbaja con núcleocon SHAPbaja
HiperparámetrosC y gamma, sensiblesvarios, interactúanmuchos
La segunda fila explica por qué se usa menos que hace quince años: el costo de entrenamiento crece entre cuadrático y cúbico con la cantidad de ejemplos, y los conjuntos de datos crecieron.

Donde sigue siendo la mejor opción es en el caso opuesto al que domina hoy: pocos ejemplos y muchas dimensiones. Clasificación de textos con miles de atributos y cientos de documentos, bioinformática, cualquier problema donde etiquetar sea caro.

En la práctica

Cierre

Maximizar el margen da una frontera robusta que depende sólo de los vectores de soporte; el margen blando la hace usable con CC como regulador. El núcleo permite separar en un espacio de más dimensiones sin construirlo, y el costo cuadrático la deja fuera de los conjuntos grandes.

Autoevaluación

¿Lo entendiste?

Entre infinitas rectas que separan dos clases, ¿cuál elige una SVM?
¿Qué son los vectores de soporte?
¿Qué regula el parámetro C del margen blando?
¿En qué consiste el truco del núcleo?