Volver a la lista

OLS · Covarianza · Diagnóstico

En el contexto de la bioestadística basada en Python, se aprenderán los conceptos clave de la regresión por mínimos cuadrados ordinarios (OLS), las covariables y el diagnóstico, así como las consideraciones importantes en el diseño de la investigación.

Intermedio
|
35min
|
Verificado (2026-08-07)
BioStatPybioestadísticaPythondiseño de investigación
Progreso0/33 (0%)

OLS, covariables y diagnóstico

Al finalizar este tema

Podrá interpretar los coeficientes de OLS como la relación entre el resultado y las covariables, y distinguir entre el éxito del ajuste y la interpretabilidad. Mediante el diagnóstico de residuos, puntos influyentes y unidades de diseño, evaluará en qué medida el modelo refleja los supuestos de la pregunta.

La pregunta precede al modelo

OLS es un modelo que expresa una relación lineal para describir la media condicional del resultado. Los coeficientes indican la relación entre la entrada y el resultado bajo la condición de que las demás entradas se mantengan fijas, pero no implican automáticamente un efecto causal en los datos observados. El hecho de incluir covariables no elimina por sí solo los problemas de confusión ni los problemas de diseño.

Acuerdo de datos y ecuación

text
outcome = beta_0 + beta_1 * exposure + beta_2 * covariate + error

Defina las unidades para cada símbolo y las unidades de observación. error representa la variación no explicada y está relacionada con supuestos como la independencia, la estructura de la media y la estructura de la varianza.

Ajuste en Python y objetos de resultados

La función OLS en statsmodels devuelve un objeto de resultados de ajuste. Debe leer los coeficientes, los errores estándar, los intervalos, los residuos y los valores de diagnóstico por separado; no determine la calidad del modelo basándose únicamente en el valor p de la tabla de resumen.

python
import statsmodels.api as sm
X = sm.add_constant(data[["exposure", "covariate"]])
model = sm.OLS(data["outcome"], X).fit()
print(model.params)
print(model.conf_int())

En un análisis real, primero se verifican el tipo de variable, los valores faltantes, las unidades y la independencia. El hecho de que se haya devuelto un objeto de resultados indica que el cálculo ha finalizado, pero no que se hayan validado las hipótesis.

Interpretación de los diagnósticos

Los residuos son la diferencia entre el resultado observado y el valor predicho por el modelo. Los patrones de los residuos, la heterocedasticidad (cambio en la varianza) y los puntos influyentes sugieren que el modelo podría no explicar adecuadamente la estructura de los datos. Los puntos influyentes no deben eliminarse automáticamente; son señales para volver a verificar las entradas, las mediciones, el diseño y la dependencia de los resultados.

En un gráfico de residuos frente a los valores ajustados, si se observa un patrón curvilíneo, se debe revisar si la estructura media lineal es suficiente. Si la amplitud de los residuos aumenta a medida que aumentan los valores ajustados, se debe reexaminar la estructura de la varianza. Si la influencia de una observación específica es grande, se deben verificar las unidades, posibles errores de entrada y el rango real de esa fila, y se puede registrar el cambio en los resultados al incluir o excluir dicha observación.

Un diagnóstico individual no determina todas las hipótesis. Se deben considerar conjuntamente los gráficos, los diagnósticos numéricos y el diseño de la investigación; si se detectan problemas, no se deben eliminar ni transformar las variables de manera mecánica.

Volver a la pregunta de investigación para la interpretación

Los coeficientes de OLS representan relaciones condicionales permitidas por el modelo y el diseño. No se puede afirmar causalidad basándose únicamente en los coeficientes de los datos observacionales; se deben informar conjuntamente el tamaño del efecto, los intervalos de confianza, las unidades y la extrapolación.

Errores comunes

  • No interpretar los coeficientes sin diagnosticar los residuos.
  • No utilizar el valor p como prueba de causalidad.
  • No eliminar automáticamente los puntos influyentes.
  • No afirmar que incluir muchas covariables elimina automáticamente el sesgo.

Resumen clave

  • OLS es un modelo que expresa la relación de la media condicional.
  • La interpretación de los coeficientes requiere comprender las unidades, el diseño y las hipótesis.
  • El éxito del ajuste y la validación del diagnóstico son conceptos distintos.

Próximo tema

En la siguiente entrega, conectaremos los resultados binarios y el log-odds mediante la regresión logística.

Referencias

Los datos y las explicaciones de esta entrega fueron escritos de forma independiente por BioStatPy.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...