Funciones de costo y su geometría
La función de costo es lo que el modelo va a optimizar, y por lo tanto lo que realmente le pediste. Elegirla mal produce modelos que funcionan perfecto según la métrica equivocada.
Para este tema conviene tener claro:Descenso por gradiente: bajar la colina
El modelo no busca “ser bueno”: busca minimizar un número. Ese número es la función de costo, y es la definición operativa de qué significa estar bien. Todo lo que no esté ahí adentro, al modelo no le importa.
Lo que una función de costo tiene que cumplir
Una buena función de costo cumple tres cosas. Refleja lo que importa del problema. Es derivable, para que haya gradiente. Y tiene una geometría que el optimizador pueda recorrer: idealmente convexa, o al menos sin regiones planas enormes.
Esos requisitos chocan seguido con la métrica de negocio. La exactitud, por ejemplo, es una función escalonada: su derivada es cero en todos lados y no da ninguna dirección. Por eso no se la puede optimizar directamente y se usa la entropía cruzada como sustituta derivable.
Antes de seguir, predecí
En regresión, el error cuadrático
En regresión, el error cuadrático medio es el default. Es suave, convexo y su gradiente es proporcional al error, lo que da pasos grandes cuando se está lejos.
Su problema es la sensibilidad a los atípicos: un error de 10 pesa cien veces más que uno de 1. El
error absoluto los trata proporcionalmente y es robusto, con la contra de no ser derivable en cero. La pérdida de Huber combina ambas: cuadrática cerca del cero, lineal lejos, y es la opción sensata cuando hay valores extremos legítimos.
En clasificación, la entropía cruzada
En clasificación, la entropía cruzada es el estándar. Compara la distribución predicha con la real y crece sin límite cuando el modelo está seguro y equivocado.
Esa forma tiene una ventaja concreta sobre el error cuadrático combinado con una sigmoide: no se satura. Con error cuadrático, un ejemplo muy mal clasificado produce gradiente casi nulo —la sigmoide está aplanada ahí— y el modelo no aprende de su peor error. Con entropía cruzada, el gradiente queda proporcional al error y el aprendizaje sigue.
Cuando los errores no cuestan lo mismo
Las funciones estándar suponen que todos los errores cuestan igual, y en la práctica casi nunca es así. Un falso negativo en un diagnóstico no equivale a un falso positivo.
La respuesta directa es ponderar las clases en el costo, para que el error caro pese más. Es preferible a manipular los datos con duplicaciones, porque expresa la asimetría donde corresponde. La pérdida focal va un paso más: baja el peso de los ejemplos fáciles para que el modelo se concentre en los difíciles, y es lo que se usa con desbalances extremos.
La regularización vive acá adentro
La regularización vive dentro de la función de costo: se suma un término que penaliza la complejidad. Así el objetivo deja de ser sólo ajustar y pasa a ser ajustar sin exagerar.
Eso vuelve explícito algo importante: el costo es donde se declaran todas las preferencias, no sólo el ajuste. Restricciones de suavidad, penalizaciones por usar ciertos atributos, términos de equidad. Si una preferencia no está en el costo, el modelo va a ignorarla.
La geometría decide qué tan fácil es optimizar
La geometría decide qué tan fácil es optimizar. Las funciones convexas tienen un solo mínimo y cualquier descenso llega. Las no convexas tienen valles, mesetas y ensilladuras.
Lo que más frena no son los mínimos locales sino las regiones planas, donde el gradiente casi se anula y el avance se detiene sin haber llegado a nada bueno. Buena parte del diseño moderno —cómo se inicializan los pesos, qué activaciones se usan, la normalización entre capas— existe para mantener los gradientes en una escala útil y evitar esas zonas.
Elegir el costo es definir el problema
| Problema | Costo | Por qué ése |
|---|---|---|
| Regresión normal | error cuadrático | derivable, penaliza más lo grande, supone ruido gaussiano |
| Regresión con atípicos | absoluto o Huber | un punto lejano no tuerce todo |
| Clasificación binaria | entropía cruzada | castiga muchísimo estar seguro y equivocado |
| Clases muy desbalanceadas | entropía cruzada con pesos, o focal | si no, la clase rara no aporta al gradiente |
| Ordenar resultados | costos de ranking | lo que importa es el orden, no el valor |
Cierre
El costo es la definición operativa de “bien”: derivable, con geometría recorrible y alineado con el problema. Cuadrático o Huber en regresión, entropía cruzada en clasificación porque no se satura, pesos por clase para errores asimétricos, y la regularización como un término más del mismo objetivo.
Autoevaluación
¿Lo entendiste?
Práctica