Volver a la lista

Puntuación de riesgo poligénico (PRS): reducción de decenas de miles de efectos individuales a un único valor.

La puntuación de riesgo poligénico (PRS) combina los efectos individuales de cientos de miles de SNPs en una única puntuación de riesgo. Se explica por qué no es recomendable utilizar solo los SNPs significativos, y se deriva directamente la fórmula de reducción bayesiana de LDpred.

Avanzado
|
22min
|
Verificado (2026-07-29)
polygenic risk scoreLDpredshrinkage estimatorclinical genomics
Progreso0/120 (0%)

S49 Efecto causal de variantes individuales, resumido en una sola puntuación a partir de cientos de miles

Hasta S49 (randomización mendeliana), se ha analizado el efecto causal de cada variante individual. Sin embargo, enfermedades comunes como la diabetes, las enfermedades coronarias y los trastornos mentales no dependen de unas pocas variantes con efectos potentes, sino que su riesgo lo determinan decenas de miles de variantes que, por separado, tienen un efecto mínimo pero actúan en conjunto. En estas enfermedades, el puntaje de riesgo poligénico (PRS, Polygenic Risk Score) resume el riesgo genético individual de una persona en un único número.

PRSi=j=1Mxijβ^j\text{PRS}_i = \sum_{j=1}^{M} x_{ij}\, \hat{\beta}_j

Es una fórmula aparentemente simple que consiste en multiplicar el genotipo xijx_{ij} del individuo ii por la magnitud del efecto β^j\hat{\beta}_j estimada en un GWAS y sumar estos productos para todos los SNPs. Sin embargo, la pregunta central que determina el rendimiento del PRS es "¿qué β^j\hat{\beta}_j utilizar?". Este capítulo se centra en explicar por qué es problemático usar directamente las magnitudes de efecto originales obtenidas del GWAS y cómo métodos bayesianos como LDpred corrigen este problema.

¿Por qué no se deben usar directamente las magnitudes de efecto originales del GWAS — derivación de la reducción bayesiana

Agrupamiento + Umbral (C+T): el método más simple pero con limitaciones claras

El método más antiguo, agrupamiento y umbral (Clumping and Thresholding, C+T), selecciona solo los SNPs que superan un umbral específico de valor p en el GWAS (umbralización) y, entre ellos, conserva solo un SNP representativo mientras descarta los demás que están en desequilibrio de ligamiento (LD) con él (agrupamiento). Aunque es común pensar erróneamente que este umbral se fija en la significancia a nivel del genoma (5×1085\times10^{-8}), el uso estándar consiste en probar varios umbrales candidatos (por ejemplo, 105,103,0.01,0.05,0.510^{-5}, 10^{-3}, 0.01, 0.05, 0.5, etc.) en una cohorte de validación y seleccionar aquel que ofrece la mayor capacidad predictiva. El problema radica en que la mayoría de las enfermedades comunes son poligénicas, lo que significa que una parte considerable de su heredabilidad se distribuye entre decenas de miles de SNPs con "señales débiles" que no alcanzan la significancia a nivel del genoma. Si solo se seleccionan los SNPs significativos, se desecha la mayor parte de esta señal distribuida.

El modelo bayesiano de LDpred: incorporación explícita de la poligenicidad mediante una distribución previa

LDpred (Vilhjálmsson et al., 2015) utiliza una distribución previa sobre el tamaño real del efecto βj\beta_j para cada SNP y calcula la media a posteriori a partir de las observaciones del GWAS para usarla como peso. El modelo general de LDpred utiliza una distribución previa del tipo punto-normal (spike-and-slab) en la que solo una fracción de los SNPs tiene un efecto, e incorpora también la matriz de correlación de LD entre los SNPs. La siguiente deducción simplifica aún más este caso al modelo infinitesimal, que asume que todos los SNPs tienen efectos pequeños, y a una aproximación simplificada de SNP independiente que asume que no hay LD entre los SNPs (es decir, la matriz de correlación de LD es la matriz identidad). Aunque el LDpred-inf real utiliza una distribución previa infinitesimal y puede incorporar LD, difiere de las ecuaciones escalares simplificadas que se presentan a continuación.

βjN ⁣(0,h2M),β^jβjN(βj,σe2)\beta_j \sim \mathcal{N}\!\left(0, \frac{h^2}{M}\right), \qquad \hat{\beta}_j \mid \beta_j \sim \mathcal{N}(\beta_j, \sigma_e^2)

donde h2h^2 es la heredabilidad del rasgo, MM es el número total de SNPs y σe2\sigma_e^2 es la varianza de la muestra de las estimaciones del GWAS (que se aproxima al inverso del tamaño de la muestra NN). Como resultado estándar del modelo conjugado normal-normal, la media a posteriori tiene la siguiente forma de contracción:

E[βjβ^j]=β^j×h2/Mh2/M+σe2\mathbb{E}[\beta_j \mid \hat{\beta}_j] = \hat{\beta}_j \times \frac{h^2/M}{h^2/M + \sigma_e^2}

Esto multiplica la estimación original del GWAS β^j\hat{\beta}_j por un factor de contracción menor que 1, atrayéndola hacia cero. Este factor de contracción tiene exactamente la misma estructura matemática que el término de regularización de la regresión Ridge.

Ejemplo de cálculo manual: contracción extrema debida a la poligenicidad

Consideremos un rasgo con heredabilidad h2=0.3h^2 = 0.3 y M=1,000,000M = 1{,}000{,}000 SNPs en total. La varianza previa por SNP es

h2M=0.31,000,000=3×107\frac{h^2}{M} = \frac{0.3}{1{,}000{,}000} = 3 \times 10^{-7}

Para un tamaño de muestra del GWAS N=100,000N=100{,}000, la varianza estimada del tamaño del efecto estandarizado es aproximadamente σe21/N=105\sigma_e^2 \approx 1/N = 10^{-5}. El factor de contracción es

3×1073×107+105=3×1071.03×1050.0291\frac{3\times10^{-7}}{3\times10^{-7} + 10^{-5}} = \frac{3\times10^{-7}}{1.03\times10^{-5}} \approx 0.0291

En otras palabras, solo se conserva aproximadamente el 2.9 % del tamaño del efecto original del GWAS, mientras que el resto se reduce hacia cero. Si la estimación original era β^j=0.05\hat{\beta}_j = 0.05, la media posterior se reduce a 0.05×0.02910.001460.05 \times 0.0291 \approx 0.00146. Aunque la reducción en un solo SNP individual es tan extrema, al sumar todos los cientos de miles de SNPs, estas pequeñas contribuciones se acumulan y contribuyen a la capacidad predictiva; esta es una estrategia opuesta a la de C+T, que solo refleja significativamente unos pocos cientos de SNPs significativos. Sin embargo, la varianza explicada (R2R^2) obtenida en la predicción fuera de la muestra suele ser menor que la heredabilidad SNP teórica h2h^2, debido al tamaño finito de la muestra del GWAS, el error de referencia de LD, la incompatibilidad del origen ancestral y la especificación incorrecta del modelo. "Recuperar la heredabilidad" se refiere únicamente a una tendencia, y no implica que R2R^2 alcance h2h^2.

Práctica en R: Reproducción de los coeficientes de reducción y el cálculo de PRS

r
# Reproducción del ejemplo de cálculo manual con código
h2 <- 0.3; M <- 1e6; N <- 1e5
prior_var <- h2 / M
se2 <- 1 / N
shrinkage <- prior_var / (prior_var + se2)

beta_hat <- 0.05
beta_posterior <- beta_hat * shrinkage
cat(sprintf("Factor de reducción: %.4f (%.1f%% del original)\n", shrinkage, shrinkage * 100))
cat(sprintf("Beta original: %.5f -> Media posterior: %.5f\n", beta_hat, beta_posterior))

# Ejemplo de cálculo de PRS a pequeña escala: comparación de pesos originales vs. reducidos para 5 SNPs
genotype <- c(2, 1, 0, 2, 1)          # Genotipo del individuo (número de alelos de riesgo)
beta_raw <- c(0.05, -0.03, 0.02, 0.04, -0.01)
beta_shrunk <- beta_raw * shrinkage

cat("PRS con pesos originales:", sum(genotype * beta_raw), "\n")
cat("PRS con pesos reducidos:", sum(genotype * beta_shrunk), "\n")

Mapeo de CS

  • Regresión Ridge: La fórmula de coeficientes ajustados derivada de la distribución previa es algebraicamente equivalente a la solución de la regresión Ridge, donde la regularización L2 desplaza las estimaciones de mínimos cuadrados hacia cero. El hecho de que una varianza previa h2/Mh^2/M más pequeña (distribuida entre más SNPs) implique una mayor intensidad de regularización se basa en el mismo principio lógico.
  • Bayes empírico: Estimar los hiperparámetros de la distribución previa (h2h^2, MM) a partir de los datos (todas las estadísticas resumidas del GWAS) para calcular la media a posteriori es una aplicación típica del Bayes empírico, donde los hiperparámetros se determinan basándose en los datos.
  • Modelo de suma ponderada lineal: El propio PRS tiene exactamente la misma forma que el valor predictivo de la regresión lineal, que consiste en multiplicar las características (genotipos de SNPs) por los pesos aprendidos y sumarlos; lo que determina el rendimiento es la forma en que se generan esos pesos (si se ajustan o no).

Problemas comunes

  • Incompatibilidad de poblaciones entre las cohortes de entrenamiento y validación (problema de portabilidad): Si se aplica directamente un PRS creado con un GWAS de ascendencia europea a individuos de otras ascendencias, la capacidad predictiva disminuye significativamente debido a las diferencias en la estructura de LD y en las frecuencias alélicas. Es esencial validar el PRS en la población objetivo antes de su aplicación clínica.
  • Juzgar la utilidad clínica solo por la varianza explicada (R2R^2): Aunque un PRS explique estadísticamente una varianza significativa, la precisión absoluta de las predicciones individuales (como el valor predictivo positivo) depende de la prevalencia y del incremento en la información de riesgo frente a los factores de riesgo existentes. Es prematuro afirmar que es "útil para la clínica" basándose únicamente en R2R^2 o AUC.
  • Asumir siempre que el modelo infinitesimal ignora la estructura de LD: La deducción anterior es una simplificación que asume la ausencia de LD (LDpred-inf). En realidad, LDpred/PRS-CS utiliza distribuciones a posteriori más complejas que reflejan la matriz de correlación de LD entre los SNPs. Esta simplificación sirve para ilustrar el principio; las puntuaciones precisas deben calcularse con un software que tenga en cuenta la LD.

Para profundizar más

El texto presentado ha sido reconstruido directamente por el equipo de investigación de BPD. Para profundizar, consulte el artículo original y la documentación oficial.

  • Artículo original de LDpred: Vilhjálmsson et al. (2015), Modelado del desequilibrio de enlace aumenta la precisión de las puntuaciones de riesgo poligénico, American Journal of Human Genetics, 97(4):576–592.
  • Artículo original de PRS-CS: Ge et al. (2019), Predicción poligénica mediante regresión bayesiana y priors de contracción continua, Nature Communications.
  • Artículo original de PRSice-2: Choi & O'Reilly (2019), PRSice-2: Software para calcular puntajes de riesgo poligénico a escala de biobancos, GigaScience.
  • Artículo sobre aplicaciones clínicas de PRS: Khera et al. (2018), Los puntajes poligénicos a nivel del genoma para enfermedades comunes identifican individuos con un riesgo equivalente a mutaciones monogénicas, Nature Genetics.

Con esto, completamos la serie de 9 partes sobre GWAS y genética de poblaciones que abarca desde S42 (pruebas de asociación GWAS) hasta S50 (aplicaciones clínicas de PRS): "identificar variantes → reducir las causas reales → relacionar con la expresión y los tejidos → analizar la estructura poblacional → estudiar regiones hipervariables → detectar variantes grandes → verificar la causalidad → y finalmente, combinar mediante puntajes predictivos". La serie S26~S50 de 25 partes del Sistema S2 (Nivel S2) también concluye con esta entrega.

A continuación, exploraremos un nivel completamente diferente: el manejo del genoma mediante modelos fundacionales (Foundation Models) que han aprendido directamente los datos de secuencia y estructura. Este es el Nivel Fullstack. En la entrega F01, repasaremos la historia de la predicción de estructuras proteicas, desde Rosetta hasta AlphaFold.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...