Poisson, offset y binomial negativa
Al finalizar este tema
Podrá distinguir entre conteo, tasa y tiempo de exposición, y explicar la función del offset en un GLM de Poisson. No seleccionará automáticamente un modelo de Poisson sin verificar la sobredispersión y comprenderá el modelo binomial negativo como una alternativa a los supuestos del modelo.
El conteo y la tasa son diferentes
El número de eventos observados durante un mismo período puede expresarse como conteo. Si los tiempos de observación difieren, no basta con comparar solo los conteos; debe considerar la tasa. El offset es el método para reflejar las diferencias en la oportunidad de observación o exposición en la predicción lineal del modelo.
Consideraciones sobre Poisson
La estructura de Poisson incluye supuestos sobre la relación entre el conteo y la variabilidad de la media. Que el conteo sea un entero no negativo no implica automáticamente que se cumplan los supuestos de Poisson. Deben verificarse la sobredispersión, la estructura de ceros y la dependencia del agrupamiento o del tiempo.
El modelo y el objeto de resultados
import numpy as npimport statsmodels.api as sm
X = sm.add_constant(data[["exposure_group"]])poisson = sm.GLM( data["count"], X, family=sm.families.Poisson(), offset=np.log(data["observation_time"]),).fit()print(poisson.params)observation_time debe ser un valor positivo con unidades definidas; el offset es la forma de incluir el logaritmo de las oportunidades de observación en el modelo. El hecho de que se haya ejecutado la API no garantiza automáticamente que la interpretación de la tasa sea correcta.
Sobredispersión y alternativas
La variabilidad observada puede ser mayor de lo que permite el supuesto de Poisson. En este caso, primero se deben identificar las causas. La repetición, la agrupación, las covariables faltantes o la estructura generadora pueden ser problemáticas; la distribución binomial negativa no es una solución universal para todas las causas. Al cambiar el modelo, registre junto con los resultados del diagnóstico los supuestos subyacentes.
Volver a la pregunta de investigación para interpretar
Los coeficientes del modelo de conteo están en la escala del enlace; los valores exponenciados pueden interpretarse como razones de tasas, pero se requieren definiciones claras de unidades y del offset. El hecho de que se haya seleccionado un modelo específico no debe utilizarse como confirmación del mecanismo generador biológico subyacente.
Errores frecuentes
- No utilice "conteo" y "tasa" como sinónimos.
- No omita el offset cuando los tiempos de observación difieren.
- No seleccione automáticamente Poisson solo porque el resultado es un número entero.
- No interprete los errores estándar sin verificar la sobredispersión.
Resumen clave
- Distinga entre conteo y tasa, incluyendo la diferencia en las oportunidades de observación.
- El offset conecta la exposición con el modelo.
- Poisson y binomial negativa tienen supuestos diferentes.
Siguiente tema
En el próximo capítulo, diferenciaremos los efectos fijos de los aleatorios dentro de los modelos mixtos.
Referencias
- GLM de statsmodels: https://www.statsmodels.org/stable/glm.html
- API de statsmodels: https://www.statsmodels.org/stable/api.html
- Diseño experimental OSTA de Bioconductor: https://bioconductor.org/books/release/OSTA/pages/bkg-exp-design.html
El esquema de conteo y el código de esta sección fueron escritos de forma independiente por BioStatPy.