Pruebas a gran escala y contracción (shrinkage)
Al finalizar este tema
Al realizar pruebas simultáneas para muchas características, es posible definir la familia y los criterios de error. Entienda el shrinkage como un método para estabilizar las estimaciones individuales; no combine los valores p corregidos, el tamaño del efecto y la incertidumbre en una única clasificación.
Cuando hay muchas características, cambia el número de preguntas
A medida que aumenta el número de genes o características, se puede formular una hipótesis para cada característica. La estructura del error difiere entre observar solo el valor p de una prueba e interpretar miles juntos. Registre primero qué constituye la familia, si es exploratorio o confirmatorio y cómo se realizará la validación posterior.
El papel de la corrección y el shrinkage
La corrección por pruebas múltiples gestiona los criterios de error en varias hipótesis. El shrinkage es un enfoque que combina estimaciones individuales con alta variabilidad con información global para producir estimaciones más estables. El shrinkage no es un mecanismo diseñado para generar valores p pequeños ni garantiza la importancia biológica.
API y manifiesto de resultados
from statsmodels.stats.multitest import multipletests
reject, adjusted_p, _, _ = multipletests( raw_p_values, method="fdr_bh", alpha=0.05)result = { "feature_id": feature_ids, "estimate": estimates, "raw_p": raw_p_values, "adjusted_p": adjusted_p, "family_id": ["F01"] * len(feature_ids),}feature_id·estimate·p-value se conserva la correspondencia fila por fila, y se registran conjuntamente las definiciones de filtrado, normalización, lote y familia. No se mezclan los valores brutos con los valores normalizados; se conservan solo los resultados sin perder la matriz de entrada.
Rangos e interpretación
La lista ordenada por el p-valor ajustado puede usarse para identificar candidatos a descubrimiento. Sin embargo, un rango alto no implica un tamaño de efecto grande ni un mecanismo validado. Se deben considerar conjuntamente la unidad del efecto estimado, los intervalos, la calidad de las características y el diseño de los lotes y réplicas.
Volver a la pregunta de investigación para interpretar
Las pruebas masivas son herramientas para gestionar el riesgo de falsos descubrimientos cuando hay muchas características. Los resultados no deben limitarse a una "lista de características significativas", sino que deben incluir el alcance del efecto, la incertidumbre, la reproducibilidad y la validación posterior.
Errores frecuentes
- No se deben confirmar las características solo con el orden del p-valor bruto.
- No se debe afirmar que la corrección FDR resuelve los problemas de lote y diseño.
- No se debe explicar el ajuste como una amplificación biológica del efecto.
- No se debe perder el mapeo entre los resultados por característica y el ID de familia.
Resumen clave
- Las pruebas masivas requieren definir primero la familia y los criterios de error.
- La corrección gestiona el error, mientras que el ajuste estabiliza la estimación; son roles distintos.
- El orden de las características no sustituye al tamaño del efecto ni a la importancia biológica.
Siguiente tema
En el siguiente módulo se conecta la estadística con el aprendizaje automático mediante la definición de un objetivo de predicción y una métrica de referencia.
Referencias
- API de pruebas múltiples de statsmodels: https://www.statsmodels.org/stable/generated/statsmodels.stats.multitest.multipletests.html
- NCBI GEO: https://www.ncbi.nlm.nih.gov/geo/info/
- Diseño experimental OSTA de Bioconductor: https://bioconductor.org/books/release/OSTA/pages/bkg-exp-design.html
El manifiesto de características y la estructura de resultados de esta entrega fueron escritos de forma independiente por BioStatPy.