Regresión logística
Al finalizar este tema
Podrá expresar un resultado binario mediante la relación entre probabilidad y log-odds, y distinguir entre coeficientes, razón de momios (odds ratio), probabilidades predichas y calibración. No exagerará el éxito del ajuste del modelo logístico, presentándolo como un rendimiento predictivo o un efecto causal.
Estructura del resultado binario
Cuando el resultado se registra en dos categorías, interpretar directamente la predicción lineal como probabilidad puede producir valores menores que 0 o mayores que 1. La regresión logística utiliza una estructura que transforma la predicción lineal a la escala de log-odds y luego la convierte a probabilidad.
Interpretación de los coeficientes
Los coeficientes representan el cambio en la escala de log-odds cuando se mantienen fijos los demás predictores. Al exponenciar un coeficiente se obtiene la razón de momios (odds ratio), pero odds y probabilidad no son iguales. La diferencia en probabilidades puede variar según la probabilidad basal, por lo que no se debe interpretar el resultado del estudio basándose únicamente en un coeficiente.
Ajuste en Python
import numpy as npimport statsmodels.api as sm
X = sm.add_constant(data[["exposure", "covariate"]])model = sm.Logit(data["outcome"], X).fit(disp=False)probability = model.predict(X)odds_ratio = model.params.apply(lambda value: np.exp(value))print(probability.head())print(odds_ratio)Este código se ejecuta con la condición de que el resultado binario, los tipos de datos adecuados y el manejo de valores faltantes estén preparados. Para usar np.exp, se debe verificar la importación de NumPy y el entorno de bloqueo. Es importante distinguir entre la generación de predicciones de probabilidad y la evaluación de una calibración adecuada.
Diagnóstico y predicción
La discriminación evalúa qué tan bien se separan los grupos, mientras que la calibración evalúa qué tan bien coinciden las probabilidades predichas con las frecuencias observadas. Una sola métrica no puede responder a ambas preguntas simultáneamente. Al aplicar umbrales para crear valores de clasificación, se debe registrar el propósito y el costo del umbral utilizado.
Volver a la pregunta de investigación para la interpretación
Los coeficientes logísticos representan las relaciones condicionales permitidas por el diseño y el modelo. No se debe interpretar el odds ratio como un riesgo causal directo a partir de los datos observados, y se debe indicar que la interpretación puede variar según la prevalencia, la línea de base y la composición de la muestra.
Errores comunes
- No usar "odds" y "probabilidad" como sinónimos.
- No confirmar directamente los coeficientes como efectos biológicos.
- No confiar en las probabilidades predichas sin calibración.
- No informar solo la precisión en casos de desequilibrio de clases.
Resumen clave
- La regresión logística modela la relación entre un resultado binario y el log-odds.
- Los coeficientes, el odds ratio y la probabilidad son escalas diferentes.
- Se deben separar la discriminación y la calibración.
Próximo tema
En la siguiente entrega se tratarán los conteos, las tasas, los desplazamientos y la sobredispersión.
Referencias
- API de statsmodels: https://www.statsmodels.org/stable/api.html
- Calibración de scikit-learn: https://scikit-learn.org/stable/modules/calibration.html
- Métricas de scikit-learn: https://scikit-learn.org/stable/modules/model_evaluation.html
La explicación y la estructura de datos de esta sección fueron escritas de forma independiente por BioStatPy.