calibración, desequilibrio e incertidumbre
Al finalizar este tema
podrá distinguir entre discriminación y calibración, y explicar el significado de la selección de métricas en datos desequilibrados. Presentará conjuntamente la división de los datos y la incertidumbre, sin convertir una probabilidad predictiva única en un juicio definitivo.
Acierto frente a precisión probabilística
La discriminación se refiere a qué tan bien se ordenan las clases positivas e negativas. La calibración se refiere a si los casos con una probabilidad predicha de 0.7 muestran aproximadamente un 70% de eventos a largo plazo. Dos modelos pueden tener un AUC similar pero diferentes niveles de calibración.
Desequilibrio
Cuando la proporción de clases positivas es baja, un modelo que predice la clase mayoritaria puede obtener una precisión alta. La precisión, el recall, la precisión promedio y la especificidad enfatizan distintos tipos de error. Se debe especificar de antemano qué tipo de error es importante y cuál es el propósito del umbral.
API de calibración y evaluación
Las herramientas de calibración de scikit-learn proporcionan una API para verificar la relación entre las probabilidades predichas y los resultados observados. Se calculan la curva de calibración y las métricas dentro de la separación de entrenamiento/prueba, asegurando que el proceso de calibración no se ajuste a información de la prueba.
Diversas fuentes de incertidumbre
Una única probabilidad predictiva puede no reflejar la incertidumbre derivada de la selección de la muestra, los parámetros del modelo, la medición de las características y los cambios en el sitio o el tiempo. Se pueden registrar las variaciones utilizando evaluaciones repetidas adecuadas al propósito, como el rendimiento por pliegue de validación cruzada, la evaluación con bootstrap y la validación externa.
Cuando el desequilibrio de clases es severo, puede haber pocas observaciones en cada bin de calibración. No se debe interpretar excesivamente solo la forma de la curva; se deben verificar conjuntamente el número de muestras por bin, los intervalos de confianza o las variaciones repetidas.
El umbral es una regla de decisión
El umbral que convierte probabilidades en clasificaciones de 0 y 1 no es una propiedad fija del modelo, sino una regla basada en el costo de los errores y el propósito de uso. No se selecciona el mejor umbral en el conjunto de prueba ni se reporta el rendimiento final de la prueba como resultado definitivo.
Volver a la pregunta de investigación para interpretar
Que las probabilidades estén bien calibradas se refiere a la confiabilidad de las probabilidades predichas, no a que el modelo explique causalidad o funcione de manera idéntica en poblaciones externas. Se deben considerar conjuntamente los cambios en sitio, tiempo y grupo, junto con la incertidumbre.
Errores frecuentes
- No se afirma que un AUC alto implica una buena calibración.
- En datos desequilibrados, no se reporta únicamente la precisión.
- La calibración no se aplica inicialmente a todo el conjunto de datos.
- La probabilidad de predicción no se interpreta como la certeza de que el evento ocurrirá.
Resumen clave
- La discriminación y la calibración son métricas de evaluación diferentes.
- En los casos de desequilibrio, es necesario especificar el propósito de la métrica y del umbral.
- La calibración también debe seguir las reglas de división y prevención de fugas de datos.
Próximo tema
En la siguiente entrega, crearemos un paquete de análisis reproducible que incluya bloqueo, semilla, hash y manifiesto.
Referencias
- scikit-learn calibration: https://scikit-learn.org/stable/modules/calibration.html
- scikit-learn metrics: https://scikit-learn.org/stable/modules/model_evaluation.html
- GroupKFold: https://scikit-learn.org/stable/modules/generated/sklearn.model_selection.GroupKFold.html
La estructura de evaluación y los ejemplos de esta entrega fueron elaborados de forma independiente por BioStatPy.