Sobreajuste, sesgo y varianza
Un modelo puede fallar por ser demasiado simple para el problema o por seguir demasiado de cerca el ruido de los datos. Son dos errores opuestos y hay que saber cuál se tiene antes de intentar arreglarlo.
Para este tema conviene tener claro:Qué significa que un modelo aprenda
Hay dos formas de equivocarse y son opuestas. Una recta que intenta describir una curva nunca va a acertar, por más datos que se le den. Un polinomio de grado veinte pasa exactamente por los veinte puntos y no sirve para predecir nada. Entre esos dos extremos está todo el oficio.
Sesgo y varianza: dos formas de errar
El sesgo es el error por supuestos demasiado rígidos: el modelo no puede representar la relación real ni con datos infinitos. Se llama subajuste, y su síntoma es error alto ya en el entrenamiento.
La varianza es la sensibilidad a los datos concretos que tocaron: con otra muestra, el modelo saldría bastante distinto. Es sobreajuste, y su síntoma es error bajísimo en entrenamiento y mucho más alto en validación. Mirar esos dos números juntos es lo primero que hay que hacer.
Antes de seguir, predecí
La descomposición del error
Formalmente, el error esperado se descompone en tres partes:
El ruido es irreducible: viene de que dos casos idénticos pueden tener resultados distintos, y ningún modelo lo puede bajar. Sirve para fijar expectativas realistas, porque marca el piso: si el error de Bayes es del 5%, apuntar al 2% es perseguir algo que no existe.
La capacidad es lo que gobierna el balance
Lo que gobierna el balance es la capacidad del modelo: cuántas funciones distintas puede representar. Más capacidad baja el sesgo y sube la varianza.
La curva clásica es una U: el error de validación baja al principio, toca un mínimo y vuelve a subir cuando el modelo empieza a memorizar. Ese mínimo es lo que se busca, y es el motivo por el que “probemos un modelo más grande” no es siempre la respuesta.
Grado 1, una recta. Los dos errores son altos y parecidos: no puede representar la relación. Eso es sesgo.
Remedios distintos: por eso hay que diagnosticar
Los remedios son distintos según el problema, y por eso importa diagnosticar primero. Con sesgo alto: un modelo con más capacidad, mejores atributos, menos regularización. Más datos no ayudan.
Con varianza alta: más datos —que acá sí ayudan—, más regularización, menos atributos, parada temprana, o combinar varios modelos. La regularización es el remedio general: penalizar la complejidad dentro de la función de costo para que el ajuste fino al ruido salga caro.
La curva de aprendizaje, la herramienta de diagnóstico
La herramienta de diagnóstico es la curva de aprendizaje: el error de entrenamiento y el de validación en función de la cantidad de datos.
Si convergen y quedan los dos altos, hay sesgo: el modelo no da para más y sumar datos no cambia nada. Si queda una brecha grande entre ambos, hay varianza, y la brecha se achica con más datos. Es una figura que ahorra semanas de prueba y error.
Dos matices que la U clásica no cubre
Dos matices actuales. El primero: los modelos muy grandes no siempre siguen la U. Pasado cierto punto de sobreparametrización el error vuelve a bajar —el doble descenso—, lo que explica que redes enormes generalicen bien pese a memorizar el entrenamiento.
El segundo: el sobreajuste más caro no es el del modelo sino el del proceso. Mirar el conjunto de prueba muchas veces para decidir cambios ajusta el proyecto entero a esos datos, aunque cada modelo individual esté bien validado. Por eso el conjunto de prueba se toca una sola vez, al final.
Diagnosticar antes de tocar nada
| Error entrenamiento | Error validación | Diagnóstico | Qué hacer |
|---|---|---|---|
| alto | alto y parecido | sesgo: el modelo no da | más capacidad, mejores atributos, menos regularización |
| bajo | mucho más alto | varianza: memorizó | más datos, más regularización, menos atributos |
| bajo | bajo | anda | no tocar, y verificar que no haya fuga |
| alto | bajo | algo está mal medido | revisar la partición: casi siempre es un error |
Los remedios de las dos primeras filas son opuestos, y por eso el diagnóstico va antes: más datos no ayudan nada contra el sesgo, y más capacidad empeora la varianza. Aplicar el remedio equivocado no sólo no arregla, mueve el problema en la dirección contraria.
Cierre
Sesgo es no poder representar; varianza es seguir el ruido. Se distinguen comparando error de entrenamiento contra validación, y cada uno tiene remedios opuestos: más capacidad de un lado, más datos y regularización del otro. El ruido irreducible fija el piso y el conjunto de prueba se usa una sola vez.
Autoevaluación
¿Lo entendiste?
Práctica