Volver a la lista

logistic regression

Se aprenderán los conceptos clave de la regresión logística y las consideraciones importantes en el diseño de la investigación, todo ello dentro del contexto de la bioestadística basada en Python.

Intermedio
|
35min
|
Verificado (2026-08-07)
BioStatPyestadística biológicaPythondiseño de investigación
Progreso0/33 (0%)

Regresión logística

Al finalizar este tema

Podrá expresar un resultado binario mediante la relación entre probabilidad y log-odds, y distinguir entre coeficientes, razón de momios (odds ratio), probabilidades predichas y calibración. No exagerará el éxito del ajuste del modelo logístico, presentándolo como un rendimiento predictivo o un efecto causal.

Estructura del resultado binario

Cuando el resultado se registra en dos categorías, interpretar directamente la predicción lineal como probabilidad puede producir valores menores que 0 o mayores que 1. La regresión logística utiliza una estructura que transforma la predicción lineal a la escala de log-odds y luego la convierte a probabilidad.

Interpretación de los coeficientes

Los coeficientes representan el cambio en la escala de log-odds cuando se mantienen fijos los demás predictores. Al exponenciar un coeficiente se obtiene la razón de momios (odds ratio), pero odds y probabilidad no son iguales. La diferencia en probabilidades puede variar según la probabilidad basal, por lo que no se debe interpretar el resultado del estudio basándose únicamente en un coeficiente.

Ajuste en Python

python
import numpy as np
import statsmodels.api as sm
X = sm.add_constant(data[["exposure", "covariate"]])
model = sm.Logit(data["outcome"], X).fit(disp=False)
probability = model.predict(X)
odds_ratio = model.params.apply(lambda value: np.exp(value))
print(probability.head())
print(odds_ratio)

Este código se ejecuta con la condición de que el resultado binario, los tipos de datos adecuados y el manejo de valores faltantes estén preparados. Para usar np.exp, se debe verificar la importación de NumPy y el entorno de bloqueo. Es importante distinguir entre la generación de predicciones de probabilidad y la evaluación de una calibración adecuada.

Diagnóstico y predicción

La discriminación evalúa qué tan bien se separan los grupos, mientras que la calibración evalúa qué tan bien coinciden las probabilidades predichas con las frecuencias observadas. Una sola métrica no puede responder a ambas preguntas simultáneamente. Al aplicar umbrales para crear valores de clasificación, se debe registrar el propósito y el costo del umbral utilizado.

Volver a la pregunta de investigación para la interpretación

Los coeficientes logísticos representan las relaciones condicionales permitidas por el diseño y el modelo. No se debe interpretar el odds ratio como un riesgo causal directo a partir de los datos observados, y se debe indicar que la interpretación puede variar según la prevalencia, la línea de base y la composición de la muestra.

Errores comunes

  • No usar "odds" y "probabilidad" como sinónimos.
  • No confirmar directamente los coeficientes como efectos biológicos.
  • No confiar en las probabilidades predichas sin calibración.
  • No informar solo la precisión en casos de desequilibrio de clases.

Resumen clave

  • La regresión logística modela la relación entre un resultado binario y el log-odds.
  • Los coeficientes, el odds ratio y la probabilidad son escalas diferentes.
  • Se deben separar la discriminación y la calibración.

Próximo tema

En la siguiente entrega se tratarán los conteos, las tasas, los desplazamientos y la sobredispersión.

Referencias

La explicación y la estructura de datos de esta sección fueron escritas de forma independiente por BioStatPy.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...