Fundamentos de los modelos mixtos
Al finalizar este tema
Podrá relacionar los efectos fijos y aleatorios con el nivel del diseño de investigación. Podrá interpretar las variables de agrupación como efectos aleatorios sin asignarlas de forma arbitraria, y analizar la estructura de repetición/agrupación y las advertencias de convergencia como parte del diagnóstico del modelo.
¿Por qué incluir una estructura jerárquica en el modelo?
Las observaciones procedentes del mismo sujeto, placa o sitio pueden compartir una variación común. Si se consideran todas las repeticiones como muestras independientes, se puede subestimar la incertidumbre, y si se resumen mediante promedios simples, se puede perder información temporal o de agrupamiento. Los modelos mixtos son una forma de separar y expresar los efectos fijos de interés de la variación específica del grupo.
Efectos fijos y aleatorios
El efecto fijo es el efecto de una condición o covariable definida previamente por el investigador, que se desea interpretar. El efecto aleatorio es una estructura que permite diferentes puntos de partida o pendientes para cada grupo, asumiendo que los grupos observados provienen de una población más amplia de grupos. Esta distinción no se determina únicamente por el tipo de dato de la variable, sino que depende del diseño de la investigación y del objetivo de la inferencia.
Estructura mínima de MixedLM
import statsmodels.formula.api as smf
model = smf.mixedlm( "outcome ~ exposure + time", data=data, groups=data["subject_id"],)result = model.fit()print(result.fe_params)subject_id es la clave del grupo para las observaciones repetidas, y el significado de exposure y time debe estar definido en el contrato de datos. Aunque se obtengan resultados de ajuste, revise las advertencias de convergencia, la estructura de efectos aleatorios, los residuos y los valores perdidos.
Verifique la estructura antes de seleccionar el modelo
No aplique un modelo mixto a todos los datos repetidos. Verifique si hay suficientes grupos, qué población representa cada grupo, si se requieren pendientes aleatorias para la pregunta de investigación y cómo se relacionan los puntos de medición con los valores perdidos. Un fallo de convergencia no es algo que simplemente deba ocultarse mediante una advertencia; es una señal para investigar problemas en el modelo, los datos o la escala.
El intercepto aleatorio permite diferentes puntos de referencia por grupo, y la pendiente aleatoria permite que la relación con las covariables o el tiempo varíe entre grupos. Una estructura de efectos aleatorios más compleja no siempre es mejor. Debe verificar si los datos contienen suficiente información para distinguir esa variabilidad y si el modelo se ajusta de manera estable.
Si hay advertencias de convergencia, no invoque repetidamente al optimizador para seleccionar solo los resultados que desaparecen. Verifique la escala de entrada, el número de observaciones por grupo, si las estimaciones de varianza están en los límites, si la estructura del modelo es excesiva y registre todos los intentos y advertencias.
Regrese a la pregunta de investigación para interpretar
Los efectos fijos representan la relación media condicionada a la estructura de grupos especificada, mientras que los efectos aleatorios expresan la variabilidad entre grupos. No interprete automáticamente estos resultados como efectos causales o mecanismos biológicos. Informe conjuntamente el nivel de agrupación, el tiempo, los valores perdidos y la extrapolación.
Errores comunes
- No utilice el ID del sujeto como una covariable numérica continua.
- No incluya todas las variables categóricas como efectos aleatorios.
- No oculte las advertencias de convergencia ni confirme los coeficientes sin realizar un análisis más exhaustivo.
- No utilice el modelo mixto como solución universal sin verificar la estructura de medición repetida.
Resumen clave
- El modelo mixto es una forma de expresar estructuras jerárquicas y repetidas.
- La distinción entre efectos fijos y aleatorios depende del diseño del estudio y del objetivo de la inferencia.
- La convergencia y el diagnóstico son parte integral de los resultados.
Próximo tema
En la siguiente entrega, abordaremos los cambios longitudinales junto con la estructura temporal del abandono y los valores perdidos.
Referencias
- API de statsmodels: https://www.statsmodels.org/stable/api.html
- Diseño experimental OSTA de Bioconductor: https://bioconductor.org/books/release/OSTA/pages/bkg-exp-design.html
El esquema jerárquico y el código de esta entrega fueron escritos de forma independiente por BioStatPy.