Objetivo de la predicción, línea de base y métrica
Al finalizar este tema
Podrá definir el objetivo de la predicción y la unidad de análisis, sin confundir la línea de base con la métrica. No evaluará el modelo únicamente con la precisión; seleccionará una métrica adecuada según los objetivos de la investigación y los costos del error.
Convertir la pregunta predictiva en un contrato de datos
La pregunta "¿Se pueden predecir los resultados de esta muestra?" requiere definir el objetivo, el momento de la predicción, las características disponibles y la unidad de evaluación. Si no se verifica si el objetivo es un resultado futuro o un valor ya observado, puede producirse una fuga de datos.
La línea de base es el punto de partida
La línea de base es el criterio mínimo en comparación con modelos complejos, como la media, la clase mayoritaria o reglas existentes. Que parezca mejorar con respecto a la línea de base solo indica una mejora dentro del diseño de evaluación específico, no que sea útil en todos los entornos.
La métrica refleja el costo de la pregunta
En la regresión, MAE y RMSE pueden tener diferentes sensibilidades al error; en la clasificación, la precisión, la exhaustividad, la curva ROC AUC y la precisión media ofrecen distintas perspectivas. En casos de desequilibrio de clases, la precisión puede reflejar solo la clase mayoritaria. Se debe documentar previamente la definición de la métrica y el motivo de su selección.
Creación de una tabla de selección de métricas
Si desea saber qué tan grande es el error predictivo en la unidad del resultado original, puede considerar métricas que mantienen la unidad, como MAE. Si se desea dar mayor peso a los errores grandes, se debe verificar la propiedad de RMSE. En la clasificación, dado que el costo de un falso negativo y el de un falso positivo pueden diferir, se vincula la prioridad entre la exhaustividad y la precisión con los objetivos de la investigación.
Aunque se pueden informar varias métricas, la métrica principal debe definirse antes de ver los resultados del modelo. Las métricas secundarias se utilizan para mostrar otros patrones de fallo del modelo, sin seleccionar solo los mejores números para representar el rendimiento general.
Mejora del modelo frente a la línea de base
La línea de base de la clase mayoritaria, la línea de base de la predicción media y la línea de base basada en reglas existentes plantean preguntas diferentes. Si el modelo supera a la línea de base, se deben informar tanto la diferencia absoluta como la incertidumbre. Determinar si una pequeña mejora en el rendimiento se mantiene en los costos operativos reales y en la validación externa es un juicio separado.
Volver a la pregunta de investigación para interpretar
El rendimiento predictivo no es un efecto causal. Un buen resultado de la métrica no garantiza mecanismos biológicos ni rendimiento en sitios externos. Se debe informar junto con la definición del objetivo, la unidad de evaluación y la división de los datos.
Errores frecuentes
- No incluir el objetivo entre las características.
- No se debe confundir la línea de base con los criterios operativos reales.
- No se debe evaluar la clasificación desequilibrada utilizando únicamente la precisión.
- No se deben seleccionar las métricas basándose en las que resulten más favorables después de revisarlas.
Puntos clave
- Defina primero el objetivo de la predicción y la unidad de evaluación.
- La línea de base sirve como punto de partida para la comparación.
- Seleccione las métricas que se ajusten a los costos de error y los objetivos de la investigación.
Próximo tema
La siguiente entrega tratará sobre las canalizaciones y las divisiones por grupo/tiempo/sitio para evitar fugas de datos.
Referencias
- Métricas de scikit-learn: https://scikit-learn.org/stable/modules/model_evaluation.html
- Calibración de scikit-learn: https://scikit-learn.org/stable/modules/calibration.html
El esquema de destino y los ejemplos de esta sección fueron creados de forma independiente por BioStatPy.