Calculamos el PRS en S50, pero ¿de dónde provienen sus tamaños de efecto?
Al calcular la puntuación de riesgo poligénico (PRS) en S50, tratamos el tamaño de efecto (beta) de cada SNP como algo ya dado. Estos tamaños de efecto provienen, en su mayoría, de archivos de estadísticas resumidas (summary statistics) de estudios GWAS a gran escala. Pan-UK Biobank es un proyecto que proporciona públicamente estas estadísticas resumidas, calculadas a través de múltiples ancestrías, sin necesidad de un proceso de aprobación para los datos genotípicos originales de UK Biobank. En D05, finalizaremos cómo manejar estas estadísticas resumidas en la práctica.
Principio — Comenzar con estadísticas agregadas en lugar de datos brutos
¿Qué es lo que comprimen las estadísticas resumidas?
Los datos genotíp tipo originales contienen qué alelo posee cada individuo en cada posición de SNP (por ejemplo, AA, AG, GG), lo que constituye información sensible con riesgo de identificación individual. Las estadísticas resumidas son una compresión de esto en estadísticas a nivel de población por cada SNP (tamaño de efecto beta, error estándar SE, p-value, frecuencia alélica).
Aquí, es el número de individuos y es el número de SNPs. La agregación reduce el riesgo de identificación individual en comparación con el genotipo original, pero no elimina por completo el riesgo de inferencia de membresía (membership inference) o la reidentificación basada en variantes raras. La disponibilidad pública se decide no solo por el nivel de agregación, sino también por el consentimiento de los participantes, la gobernanza y las políticas de distribución. Pan-UK Biobank proporciona estadísticas resumidas públicas siguiendo esta política, pero los usuarios deben cumplir con los términos y condiciones actuales de dichos datos.
Lo que aporta Pan-UK Biobank — Análisis multi-ancestry
Los GWAS estándar de UK Biobank han tendido a concentrarse mayoritariamente en muestras de ascendencia europea. La página pública de Pan-UK Biobank explica que proporciona resultados de 16,131 GWAS en total, cubriendo 7,228 fenotipos y grupos de ancestría de 6 continentes. Esto es útil para diagnosticar el problema de la portabilidad del PRS, es decir, el problema (mencionado en S50) de que un PRS entrenado con muestras europeas pierde capacidad predictiva en otros grupos de ancestría. El uso conjunto de estadísticas de varios grupos no resuelve automáticamente el problema de la portabilidad; se requiere una validación por grupo.
Ejemplo de cálculo manual: Metaanálisis de estadísticas resumidas de dos grupos de ancestría
Si se dispone de estadísticas resumidas para un mismo SNP en grupos de ascendencia europea (beta=0.15, SE=0.02) y de ascendencia esteasiática (beta=0.11, SE=0.03), es posible calcular el tamaño del efecto combinado mediante un metaanálisis ponderado por la inversa de la varianza.
Se puede comprobar directamente que la estructura asigna un mayor peso al tamaño del efecto de los grupos con menor error estándar (muestras más grandes o mediciones más precisas).
Práctica: carga de estadísticas resumidas y cálculo simple de PRS (Colab R)
# Ejecutar en el entorno R de Colab. Se usa un esquema simplificado de estadísticas resumidas con fines didácticos.
# Para el formato y los campos reales de Pan-UKB, consulta el formato de distribución y la documentación de la versión.
summary_stats <- data.frame(
rsid = c("rs1", "rs2", "rs3", "rs4"),
beta = c(0.15, -0.08, 0.22, 0.05),
se = c(0.02, 0.03, 0.04, 0.02),
pval = c(1e-12, 3e-4, 5e-9, 0.02)
)
# Se supone el número de alelos por SNP de una persona (0/1/2); en la práctica se carga desde un archivo VCF/PLINK
individual_dosage <- c(2, 1, 0, 1)
# PRS = sum(dosage_i * beta_i), exactamente como se define en S50
prs <- sum(individual_dosage * summary_stats$beta)
cat("Puntuación PRS individual:", prs, "\n")
# Filtrar SNP por umbral de significación y recalcular el PRS (PRS basado en umbral, ampliación de S50)
sig_snps <- summary_stats$pval < 5e-8
prs_strict <- sum(individual_dosage[sig_snps] * summary_stats$beta[sig_snps])
cat("PRS usando solo SNP significativos:", prs_strict, "\n")El archivo real de Pan-UK Biobank contiene millones de SNPs; cargar todos a la vez en data.frame de R puede provocar problemas de memoria. En la práctica, es más seguro procesarlos de forma secuencial utilizando las funciones de data.table::fread o PLINK2 de --score.
Correspondencia de conceptos
- Datos agregados vs. datos brutos: Las estadísticas resumidas son una forma de preagregación de los registros brutos en valores estadísticos; se parecen a las vistas materializadas de una base de datos, ya que reutilizan resultados calculados previamente sin necesidad de escanear los datos brutos cada vez.
- Procesamiento eficiente en memoria mediante transmisión de datos: Al trabajar con millones de estadísticas resumidas de SNPs, procesar los datos línea por línea en lugar de cargarlos todos en la memoria es un patrón estándar de los algoritmos de transmisión de datos para archivos de gran tamaño.
Errores comunes
- Aplicar directamente las estadísticas resumidas de un grupo ancestral a individuos de otro grupo ancestral: La capacidad predictiva de la PRS disminuye sistemáticamente a medida que el grupo ancestral en el que se realizó el GWAS y el grupo ancestral del sujeto son más diferentes. Si existen estadísticas resumidas divididas por grupos, como en Pan-UK Biobank, se debe priorizar el uso de las estadísticas del grupo más cercano al sujeto.
- Seleccionar SNPs únicamente mediante umbrales de valor p e ignorar el desequilibrio de ligamiento (LD): Si los SNPs significativos están fuertemente correlacionados entre sí (lo que implica contar la misma señal varias veces), la PRS puede sobreestimarse. En la práctica, se realiza primero un procedimiento de agrupación y selección para corregir el LD antes de calcular la PRS.
Para obtener más información
El texto ha sido reescrito directamente por el equipo de investigación del BPD.
- Sitio web oficial de Pan-UK Biobank: Descarga de estadísticas resumidas por grupo ancestral y documentación.
- Documentación oficial de PLINK2
--score: Referencia de la línea de comandos para el cálculo de la PRS basado en estadísticas resumidas. - Artículo sobre la transferibilidad de la PRS (Martin et al., 2019, Nature Genetics): El artículo original que aborda la diferencia en la capacidad predictiva de la PRS entre grupos ancestrales.
Con esto, se completa el episodio 5 de la serie D, finalizando la redacción del borrador en coreano del catálogo completo de 120 episodios (M+S1+S2+F1+F2+D). A continuación, Codex realizará la verificación estadística y factual, seguida de la integración en el repositorio y la traducción de los episodios que superen la verificación.