Atlasingeniería

Aprendizaje automáticoOptimizaciónTema 2

Funciones de costo y su geometría

La función de costo es lo que el modelo va a optimizar, y por lo tanto lo que realmente le pediste. Elegirla mal produce modelos que funcionan perfecto según la métrica equivocada.

Para este tema conviene tener claro:Descenso por gradiente: bajar la colina

El modelo no busca “ser bueno”: busca minimizar un número. Ese número es la función de costo, y es la definición operativa de qué significa estar bien. Todo lo que no esté ahí adentro, al modelo no le importa.

Lo que una función de costo tiene que cumplir

Una buena función de costo cumple tres cosas. Refleja lo que importa del problema. Es derivable, para que haya gradiente. Y tiene una geometría que el optimizador pueda recorrer: idealmente convexa, o al menos sin regiones planas enormes.

Esos requisitos chocan seguido con la métrica de negocio. La exactitud, por ejemplo, es una función escalonada: su derivada es cero en todos lados y no da ninguna dirección. Por eso no se la puede optimizar directamente y se usa la entropía cruzada como sustituta derivable.

Antes de seguir, predecí

Usás error cuadrático medio en un problema de clasificación en vez de entropía cruzada. ¿Qué pasa?

En regresión, el error cuadrático

En regresión, el error cuadrático medio es el default. Es suave, convexo y su gradiente es proporcional al error, lo que da pasos grandes cuando se está lejos.

Su problema es la sensibilidad a los atípicos: un error de 10 pesa cien veces más que uno de 1. El

Movete hacia los extremos y mirá la pendiente: a mayor error, gradiente más grande y paso más largo. Eso es lo bueno del cuadrático. Lo malo es lo mismo: un solo dato lejos tira de toda la solución.f(x) = x ^ 2

error absoluto los trata proporcionalmente y es robusto, con la contra de no ser derivable en cero. La pérdida de Huber combina ambas: cuadrática cerca del cero, lineal lejos, y es la opción sensata cuando hay valores extremos legítimos.

En clasificación, la entropía cruzada

En clasificación, la entropía cruzada es el estándar. Compara la distribución predicha con la real y crece sin límite cuando el modelo está seguro y equivocado.

Esa forma tiene una ventaja concreta sobre el error cuadrático combinado con una sigmoide: no se satura. Con error cuadrático, un ejemplo muy mal clasificado produce gradiente casi nulo —la sigmoide está aplanada ahí— y el modelo no aprende de su peor error. Con entropía cruzada, el gradiente queda proporcional al error y el aprendizaje sigue.

Cuando los errores no cuestan lo mismo

Las funciones estándar suponen que todos los errores cuestan igual, y en la práctica casi nunca es así. Un falso negativo en un diagnóstico no equivale a un falso positivo.

La respuesta directa es ponderar las clases en el costo, para que el error caro pese más. Es preferible a manipular los datos con duplicaciones, porque expresa la asimetría donde corresponde. La pérdida focal va un paso más: baja el peso de los ejemplos fáciles para que el modelo se concentre en los difíciles, y es lo que se usa con desbalances extremos.

La regularización vive acá adentro

La regularización vive dentro de la función de costo: se suma un término que penaliza la complejidad. Así el objetivo deja de ser sólo ajustar y pasa a ser ajustar sin exagerar.

Eso vuelve explícito algo importante: el costo es donde se declaran todas las preferencias, no sólo el ajuste. Restricciones de suavidad, penalizaciones por usar ciertos atributos, términos de equidad. Si una preferencia no está en el costo, el modelo va a ignorarla.

La geometría decide qué tan fácil es optimizar

La geometría decide qué tan fácil es optimizar. Las funciones convexas tienen un solo mínimo y cualquier descenso llega. Las no convexas tienen valles, mesetas y ensilladuras.

Lo que más frena no son los mínimos locales sino las regiones planas, donde el gradiente casi se anula y el avance se detiene sin haber llegado a nada bueno. Buena parte del diseño moderno —cómo se inicializan los pesos, qué activaciones se usan, la normalización entre capas— existe para mantener los gradientes en una escala útil y evitar esas zonas.

Elegir el costo es definir el problema

ProblemaCostoPor qué ése
Regresión normalerror cuadráticoderivable, penaliza más lo grande, supone ruido gaussiano
Regresión con atípicosabsoluto o Huberun punto lejano no tuerce todo
Clasificación binariaentropía cruzadacastiga muchísimo estar seguro y equivocado
Clases muy desbalanceadasentropía cruzada con pesos, o focalsi no, la clase rara no aporta al gradiente
Ordenar resultadoscostos de rankinglo que importa es el orden, no el valor
La cuarta fila es la que más se descuida: con un 1 % de positivos, el costo está dominado por la clase mayoritaria y el modelo aprende a decir siempre que no.

Cierre

El costo es la definición operativa de “bien”: derivable, con geometría recorrible y alineado con el problema. Cuadrático o Huber en regresión, entropía cruzada en clasificación porque no se satura, pesos por clase para errores asimétricos, y la regularización como un término más del mismo objetivo.

Autoevaluación

¿Lo entendiste?

¿Por qué no se puede optimizar directamente la exactitud?
¿Qué le importa al modelo durante el entrenamiento?
¿Cuál es el problema del error cuadrático medio?
¿Qué tres cosas debería cumplir una función de costo?