Atlasingeniería

Aprendizaje automáticoFundamentosTema 4

Métricas: exactitud, precisión, recall y AUC

Con un 1% de casos positivos, un modelo que siempre dice que no tiene 99% de exactitud y es inútil. Elegir la métrica es decidir qué error duele más, y eso no lo dice la matemática.

Para este tema conviene tener claro:Probabilidad condicional e independencia

Un detector de fraude sobre transacciones donde el 1% es fraudulento puede alcanzar 99% de exactitud sin hacer nada: basta con responder “no es fraude” siempre. La exactitud no está mal calculada; está mal elegida.

Todo sale de la matriz de confusión

Todo sale de la matriz de confusión: verdaderos positivos, falsos positivos, verdaderos negativos y falsos negativos. Las métricas son distintas formas de resumir esos cuatro números en uno, y cada resumen pierde algo.

La exactitud es la proporción de aciertos totales. Sirve cuando las clases están balanceadas y los dos errores cuestan parecido. Fuera de ese caso, engaña.

Mil transacciones, 10 fraudulentas. El modelo que siempre dice «no es fraude» tiene 99% de exactitud.

1 / 4
Las dos matrices tienen exactitud parecida y no sirven para lo mismo. Mirar los cuatro números antes que cualquier métrica resumida es lo que evita el error.

Antes de seguir, predecí

Una enfermedad afecta a 1 de cada 1000. Un modelo dice siempre «sano». ¿Qué exactitud tiene?

Precisión y recall: dos preguntas distintas

La precisión responde: de los que marqué como positivos, ¿cuántos lo eran? Es la métrica de quien sufre las falsas alarmas.

El recall responde: de los positivos que existían, ¿cuántos encontré? Es la métrica de quien sufre los casos que se escapan. Se tensionan entre sí: marcar más casos sube el recall y baja la precisión. El F1 es su media armónica, útil como resumen único y peligroso cuando los dos errores no cuestan lo mismo, porque los pondera igual.

El umbral, que es una decisión de negocio

La clave que ordena todo: casi todos los clasificadores no devuelven una clase sino un puntaje. La clase aparece recién al comparar ese puntaje con un umbral.

Así que precisión y recall no son propiedades del modelo: son propiedades del modelo más el umbral elegido. Mover el umbral recorre toda la curva sin reentrenar nada, y elegirlo es una decisión de negocio, no de modelado: ¿qué cuesta más, revisar una alarma falsa o dejar pasar un fraude?

Las curvas, para evaluar sin fijar umbral

Para evaluar el modelo con independencia del umbral están las curvas. La ROC grafica el recall contra la tasa de falsos positivos para todos los umbrales, y el área bajo ella —AUC— se interpreta como la probabilidad de que el modelo le dé mayor puntaje a un positivo al azar que a un negativo al azar.

Con clases muy desbalanceadas, la ROC se vuelve optimista, porque la tasa de falsos positivos se diluye en un denominador enorme. Ahí conviene la curva de precisión contra recall, que no usa los verdaderos negativos y muestra el problema real.

En regresión el panorama es otro

En regresión el panorama es distinto. El error cuadrático medio castiga fuerte los errores grandes y es sensible a los valores atípicos; el error absoluto medio los trata proporcionalmente y es más robusto.

El R2R^2 dice qué fracción de la varianza explica el modelo, y conviene leerlo con cuidado: siempre sube al agregar variables, aunque sean ruido. Y en problemas de negocio suele importar el error relativo, no el absoluto: errar 100enunaventade100 en una venta de 200 no es lo mismo que en una de $100.000.

La calibración, que se olvida siempre

Hay una propiedad aparte que se olvida: la calibración. Si el modelo dice 0.8, ¿pasa efectivamente el 80% de las veces? Un modelo puede ordenar perfecto —AUC alta— y estar pésimamente calibrado.

Importa cuando la probabilidad alimenta una decisión económica: un valor esperado se calcula con probabilidades reales, no con puntajes. Se diagnostica con un gráfico de calibración y se corrige con métodos posteriores al entrenamiento, sin tocar el modelo.

Elegir la métrica es elegir qué error duele

MétricaQué preguntaCuándo importa
Exactitud¿cuántas acerté?clases balanceadas y errores de costo parecido
Precisiónde las que marqué, ¿cuántas eran?marcar de más es caro: bloquear cuentas
Recallde las que eran, ¿cuántas marqué?dejar pasar es caro: fraude, diagnóstico
F1promedio armónico de las doshacen falta las dos y no hay una preferencia clara
AUC-ROC¿ordena bien?comparar modelos sin fijar un umbral
AUC-PRlo mismo, con clases muy desbalanceadasla positiva es el 1 %
Con una clase al 1 %, el AUC-ROC se ve bien casi siempre porque los verdaderos negativos son muchísimos. El AUC-PR no se deja engañar, y es la métrica que corresponde ahí.

Cierre

La matriz de confusión es la fuente; cada métrica resume distinto. Precisión y recall dependen del umbral, que es una decisión de negocio; AUC evalúa el orden, y con desbalance conviene precisión contra recall. Y si la probabilidad va a usarse como número, hay que calibrarla.

Autoevaluación

¿Lo entendiste?

99% de exactitud en un detector de fraude donde el 1% es fraude. ¿Qué significa?
¿Qué responde la precisión?
¿Por qué precisión y recall se tensionan?
¿Cuándo es peligroso resumir con F1?