Métricas: exactitud, precisión, recall y AUC
Con un 1% de casos positivos, un modelo que siempre dice que no tiene 99% de exactitud y es inútil. Elegir la métrica es decidir qué error duele más, y eso no lo dice la matemática.
Para este tema conviene tener claro:Probabilidad condicional e independencia
Un detector de fraude sobre transacciones donde el 1% es fraudulento puede alcanzar 99% de exactitud sin hacer nada: basta con responder “no es fraude” siempre. La exactitud no está mal calculada; está mal elegida.
Todo sale de la matriz de confusión
Todo sale de la matriz de confusión: verdaderos positivos, falsos positivos, verdaderos negativos y falsos negativos. Las métricas son distintas formas de resumir esos cuatro números en uno, y cada resumen pierde algo.
La exactitud es la proporción de aciertos totales. Sirve cuando las clases están balanceadas y los dos errores cuestan parecido. Fuera de ese caso, engaña.
Mil transacciones, 10 fraudulentas. El modelo que siempre dice «no es fraude» tiene 99% de exactitud.
Antes de seguir, predecí
Precisión y recall: dos preguntas distintas
La precisión responde: de los que marqué como positivos, ¿cuántos lo eran? Es la métrica de quien sufre las falsas alarmas.
El recall responde: de los positivos que existían, ¿cuántos encontré? Es la métrica de quien sufre los casos que se escapan. Se tensionan entre sí: marcar más casos sube el recall y baja la precisión. El F1 es su media armónica, útil como resumen único y peligroso cuando los dos errores no cuestan lo mismo, porque los pondera igual.
El umbral, que es una decisión de negocio
La clave que ordena todo: casi todos los clasificadores no devuelven una clase sino un puntaje. La clase aparece recién al comparar ese puntaje con un umbral.
Así que precisión y recall no son propiedades del modelo: son propiedades del modelo más el umbral elegido. Mover el umbral recorre toda la curva sin reentrenar nada, y elegirlo es una decisión de negocio, no de modelado: ¿qué cuesta más, revisar una alarma falsa o dejar pasar un fraude?
Las curvas, para evaluar sin fijar umbral
Para evaluar el modelo con independencia del umbral están las curvas. La ROC grafica el recall contra la tasa de falsos positivos para todos los umbrales, y el área bajo ella —AUC— se interpreta como la probabilidad de que el modelo le dé mayor puntaje a un positivo al azar que a un negativo al azar.
Con clases muy desbalanceadas, la ROC se vuelve optimista, porque la tasa de falsos positivos se diluye en un denominador enorme. Ahí conviene la curva de precisión contra recall, que no usa los verdaderos negativos y muestra el problema real.
En regresión el panorama es otro
En regresión el panorama es distinto. El error cuadrático medio castiga fuerte los errores grandes y es sensible a los valores atípicos; el error absoluto medio los trata proporcionalmente y es más robusto.
El dice qué fracción de la varianza explica el modelo, y conviene leerlo con cuidado: siempre sube al agregar variables, aunque sean ruido. Y en problemas de negocio suele importar el error relativo, no el absoluto: errar 200 no es lo mismo que en una de $100.000.
La calibración, que se olvida siempre
Hay una propiedad aparte que se olvida: la calibración. Si el modelo dice 0.8, ¿pasa efectivamente el 80% de las veces? Un modelo puede ordenar perfecto —AUC alta— y estar pésimamente calibrado.
Importa cuando la probabilidad alimenta una decisión económica: un valor esperado se calcula con probabilidades reales, no con puntajes. Se diagnostica con un gráfico de calibración y se corrige con métodos posteriores al entrenamiento, sin tocar el modelo.
Elegir la métrica es elegir qué error duele
| Métrica | Qué pregunta | Cuándo importa |
|---|---|---|
| Exactitud | ¿cuántas acerté? | clases balanceadas y errores de costo parecido |
| Precisión | de las que marqué, ¿cuántas eran? | marcar de más es caro: bloquear cuentas |
| Recall | de las que eran, ¿cuántas marqué? | dejar pasar es caro: fraude, diagnóstico |
| F1 | promedio armónico de las dos | hacen falta las dos y no hay una preferencia clara |
| AUC-ROC | ¿ordena bien? | comparar modelos sin fijar un umbral |
| AUC-PR | lo mismo, con clases muy desbalanceadas | la positiva es el 1 % |
Cierre
La matriz de confusión es la fuente; cada métrica resume distinto. Precisión y recall dependen del umbral, que es una decisión de negocio; AUC evalúa el orden, y con desbalance conviene precisión contra recall. Y si la probabilidad va a usarse como número, hay que calibrarla.
Autoevaluación
¿Lo entendiste?
Práctica