Volver a la lista

Aleatorización mendeliana: Utilizar variantes genéticas como un ensayo de asignación aleatoria natural

Los estudios observacionales no están libres de variables de confusión. La aleatorización mendeliana aborda el principio de inferencia causal utilizando variantes genéticas como variables instrumentales, mediante ejemplos de estimación con IVW y cálculos manuales.

Avanzado
|
22min
|
Verificado (2026-07-29)
Mendelian randomizationinstrumental variablecausal inferencedrug target
Progreso0/120 (0%)

Tras observar la variante S48, ahora preguntamos: "¿Es realmente la causa?"

Hasta ahora hemos localizado variantes (GWAS), las hemos reducido a variantes causales verdaderas (fine-mapping) y las hemos conectado con los genes cuya expresión alteran (eQTL). Sin embargo, todo este análisis sigue siendo un estudio observacional. El hecho de observar una correlación —"las personas con colesterol LDL alto tienen más probabilidades de desarrollar enfermedades cardíacas"— no permite concluir directamente que reducir el LDL disminuirá la incidencia de enfermedades cardíacas, ya que podría haber variables de confusión (confounder) que afecten a ambos factores, como el tabaquismo, la falta de ejercicio o los hábitos alimenticios.

La aleatorización mendeliana (MR, Mendelian Randomization) esquiva este problema aprovechando una propiedad especial de la genética. La herencia de un alelo específico de los padres se determina mediante la segregación aleatoria durante la meiosis en el momento de la fecundación; por esta razón, a menudo se compara con una asignación aleatoria realizada por la naturaleza antes del nacimiento (aunque volveremos a señalar más adelante que esta analogía no es perfecta). En esta sección, derivaremos los principios estadísticos de la MR para inferir relaciones causales utilizando variantes genéticas como variables instrumentales, y al final examinaremos cómo se aplica a la farmacogenómica dirigida a dianas (drug-target MR).

Supuestos fundamentales de las variables instrumentales y estimación IVW

Los tres supuestos necesarios para que una variable instrumental sea válida

Para utilizar una variante genética GG como variable instrumental e inferir la relación causal entre la variable de exposición XX (por ejemplo, el colesterol LDL) y la variable de resultado YY (por ejemplo, las enfermedades cardíacas), se requieren las siguientes tres condiciones:

  1. Relevancia: GG debe estar fuertemente asociada con XX (βGX0\beta_{GX} \neq 0, una condición ya confirmada en los estudios GWAS).
  2. Independencia: GG debe ser independiente de las variables que confunden la relación entre XX e YY. Aunque la segregación aleatoria durante la meiosis proporciona el fundamento teórico, en los datos reales este supuesto puede violarse debido a la estratificación poblacional, el apareamiento selectivo (assortative mating), los efectos genéticos indirectos de la generación parental (dynastic effect) y sesgos de supervivencia o selección, por lo que se requieren verificaciones adicionales.
  3. Restricción de exclusión: GG debe afectar a YY únicamente a través de XX. Si GG influye directamente en YY mediante otras vías independientes de XX (pleiotropía horizontal), este supuesto se viola.

Estimador de la razón de Wald: estimación del efecto causal con una sola variante

Si se obtienen el efecto de GG sobre XX, βGX\beta_{GX}, y el efecto de GG sobre YY, βGY\beta_{GY}, respectivamente, de los GWAS correspondientes, la estimación del ratio de Wald para el efecto causal de XYX \to Y es la siguiente.

β^XY=βGYβGX\hat{\beta}_{XY} = \frac{\beta_{GY}}{\beta_{GX}}

Esto implica calcular a posteriori cuánto cambia YY cuando GG modifica XX en una unidad, mediante la proporción de los efectos que GG tiene sobre cada variable. Si βGX\beta_{GX} y βGY\beta_{GY} se estimaron en muestras distintas (independientes), esto se denomina MR de dos muestras (Two-sample MR). El hecho de que solo sean necesarios estadísticos resumidos es una ventaja práctica de este método, pero el "uso de estadísticos resumidos" no define el diseño de dos muestras: también es posible realizar MR con estadísticos resumidos obtenidos de la misma muestra (one-sample), caso en el cual persiste un problema de sesgo derivado de la superposición de muestras.

Estimación IVW ponderada por inversa de varianza para combinar múltiples variantes

Dado que una sola variante produce estimaciones inestables, se combinan los ratios de Wald de múltiples variables instrumentales G1,,GJG_1, \dots, G_J independientes (sin LD). El estimador ponderado por inversa de varianza (IVW, Inverse-Variance Weighted) equivale a una regresión por mínimos cuadrados ponderados que pasa por el origen.

β^IVW=j=1Jwjβ^XY,jj=1Jwj,wj=βGX,j2se(βGY,j)2\hat{\beta}_{IVW} = \frac{\sum_{j=1}^{J} w_j \, \hat{\beta}_{XY,j}}{\sum_{j=1}^{J} w_j}, \quad w_j = \frac{\beta_{GX,j}^2}{\text{se}(\beta_{GY,j})^2}

Los pesos wjw_j se asignan con mayor magnitud cuanto mayor es el efecto de la variante sobre XX y cuanto menor es el error estándar de la estimación del efecto sobre YY (es decir, mayor precisión), otorgando así mayor influencia a las variantes más confiables.

Ejemplo de cálculo manual: Estimación del efecto causal IVW con 3 variantes

Supongamos que los tamaños de efecto de exposición y resultado para tres SNPs son los siguientes.

SNPβGX\beta_{GX}βGY\beta_{GY}se(βGY)\text{se}(\beta_{GY})
10.200.080.020
20.150.060.030
30.300.110.025

Calcule el ratio de Wald y el peso para cada SNP.

β^1=0.080.20=0.400,w1=0.2020.0202=100\hat{\beta}_1 = \frac{0.08}{0.20} = 0.400, \quad w_1 = \frac{0.20^2}{0.020^2} = 100

β^2=0.060.15=0.400,w2=0.1520.0302=25\hat{\beta}_2 = \frac{0.06}{0.15} = 0.400, \quad w_2 = \frac{0.15^2}{0.030^2} = 25

β^3=0.110.300.3667,w3=0.3020.0252=144\hat{\beta}_3 = \frac{0.11}{0.30} \approx 0.3667, \quad w_3 = \frac{0.30^2}{0.025^2} = 144

β^IVW=100(0.400)+25(0.400)+144(0.3667)100+25+144=40+10+52.80269102.802690.382\hat{\beta}_{IVW} = \frac{100(0.400) + 25(0.400) + 144(0.3667)}{100+25+144} = \frac{40 + 10 + 52.80}{269} \approx \frac{102.80}{269} \approx 0.382

El hecho de que las tres estimaciones puntuales (0,400, 0,400 y 0,367) no difieran significativamente entre sí y converjan hacia la estimación IVW (0,382) es una señal positiva; si un solo SNP mostrara una estimación puntual notablemente diferente, debería sospecharse que dicho SNP viola el supuesto de exclusión y podría ser una variante pleiotrópica.

MR-Egger: Prueba de intercepción para detectar pleiotropía

IVW asume que el supuesto de exclusión se cumple en todas las variantes. La regresión MR-Egger (Bowden et al., 2015) realiza una regresión de βGY,j\beta_{GY,j} sobre βGX,j\beta_{GX,j} sin forzar que la intercepción sea cero, para probar si esta se desvía significativamente de cero. Una intercepción distinta de cero indica que las variantes afectan a YY directamente fuera de la vía de XX, lo cual es evidencia de pleiotropía direccional.

Práctica en R: Replicación de la estimación IVW

r
# Repetición del ejemplo de cálculo de 3-SNP en código
beta_gx <- c(0.20, 0.15, 0.30)
beta_gy <- c(0.08, 0.06, 0.11)
se_gy   <- c(0.020, 0.030, 0.025)

wald_ratio <- beta_gy / beta_gx
weight <- beta_gx^2 / se_gy^2

ivw_estimate <- sum(weight * wald_ratio) / sum(weight)

cat("Relación de Wald por SNP:", round(wald_ratio, 4), "\n")
cat("Peso por SNP:", round(weight, 2), "\n")
cat(sprintf("Estimación del efecto causal IVW: %.4f\n", ivw_estimate))

# Prueba de intersección MR-Egger: beta_gy ~ beta_gx (mínimos cuadrados ponderados, con intersección)
# Nota: Los pesos de la regresión de Egger no son el peso a escala de razón del IVW(beta_gx^2/se_gy^2), sino
# 1/se_gy^2 — separamos en variables distintas para no confundir los dos pesos.
# (Además, con 3 SNPs para estimar intersección y pendiente, quedan solo 1 grado de libertad residual,
# por lo que la prueba de significancia de la intersección en este ejemplo tiene poco más valor que una demostración educativa.)
egger_weight <- 1 / se_gy^2
egger_fit <- lm(beta_gy ~ beta_gx, weights = egger_weight)
cat("Intersección MR-Egger (señal pleiotrópica):", round(coef(egger_fit)[1], 5), "\n")

Mapeo de MR

  • Variables instrumentales (Instrumental Variables): Calcular el efecto causal a través de una variable exógena que no se ve afectada por variables de confusión tiene una estructura matemáticamente idéntica al método de mínimos cuadrados en dos etapas (2SLS) de la econometría.
  • Mínimos cuadrados ponderados (Weighted Least Squares): El estimador IVW es un caso especial que aplica la técnica estándar de regresión, que asigna mayor peso a las observaciones con mayor precisión, a una regresión que pasa por el origen.
  • Verificación de robustez (Robustness Check): Realizar pruebas separadas para señales que solo aparecen cuando se violan los supuestos clave, como la prueba de intersección de MR-Egger, y así validar cruzadamente la confianza en el estimador principal, refleja el mismo enfoque que verificar por separado los casos límite en las pruebas de software.

Defectos comunes

  • Uso de variables instrumentales débiles (Weak Instrument): Si se utiliza una variante con un estadístico F bajo (convencionalmente menor de 10) como instrumento, aunque βGX\beta_{GX} sea estadísticamente significativo, se produce sesgo por variable instrumental débil. La dirección del sesgo depende del diseño del estudio: en el MR de una sola muestra (one-sample), donde las muestras de exposición y resultado se superponen, tiende a sesgarse hacia la dirección de la asociación observada confundida; en el MR de dos muestras (two-sample), donde se estiman exposición y resultado en dos muestras independientes, generalmente se debilita hacia la hipótesis nula.
  • No identificación de LD entre variables instrumentales: Tratar variantes de SNP fuertemente asociadas (alto LD) como variables instrumentales independientes provoca el cálculo duplicado de la misma señal y una subestimación de la varianza. Deben seleccionarse solo variantes independientes mediante clumping.
  • Informar solo los resultados de IVW y omitir análisis de sensibilidad: Si los estimadores de varios métodos de análisis de sensibilidad, como MR-Egger, mediana ponderada (weighted median) y MR-PRESSO, difieren considerablemente entre sí, es probable que exista pleiotropía. Es peligroso sacar conclusiones basándose únicamente en IVW.

Drug-target MR: Aplicación a la genética de dianas farmacológicas

Si XX tratado hasta ahora ha sido una variable de exposición general como el colesterol LDL, en el drug-target MR se coloca en la posición de exposición la expresión o actividad de la proteína diana de un fármaco específico (por ejemplo, los niveles de la proteína PCSK9 medidos mediante eQTL y pQTL). Al estimar el efecto causal que las variantes genéticas que reducen dicha proteína tienen sobre un rasgo de resultado (por ejemplo, el riesgo de enfermedad cardíaca), se puede anticipar si un fármaco que inhibe esa diana podría tener efectos antes de los ensayos clínicos; de hecho, el desarrollo de inhibidores de PCSK9 se cita a menudo como un caso respaldado por esta evidencia genética previa. No obstante, aunque se aplican directamente los principios de IVW y MR-Egger, en la genética de dianas farmacológicas son adicionales los siguientes aspectos importantes:

  • Agrupar varios SNPs de la ventana cis como variables instrumentales sin verificar la colocalización (ver S45) para confirmar si la exposición y el resultado comparten la misma variante causal puede llevar a conclusiones causales erróneas, ya que variantes distintas podrían mezclarse por azar.
  • El efecto acumulado de las variantes genéticas a lo largo de toda la vida y el efecto de tomar un medicamento durante un breve período en la edad adulta pueden diferir en magnitud y patrón; no se debe trasladar directamente una estimación de MR como "tomar este medicamento tendrá exactamente este efecto".

Para profundizar más

El texto principal ha sido reescrito por el equipo de investigación del BPD. Profundice consultando el artículo original y la documentación oficial.

  • Artículo fundacional sobre el concepto de MR: Davey Smith & Ebrahim (2003), 'Mendelian randomization': can genetic epidemiology contribute to understanding environmental determinants of disease?, International Journal of Epidemiology.
  • Artículo sobre la metodología IVW: Burgess, Butterworth & Thompson (2013), Mendelian Randomization Analysis With Multiple Genetic Variants Using Summarized Data, Genetic Epidemiology.
  • Artículo original de MR-Egger: Bowden, Davey Smith & Burgess (2015), Mendelian randomization with invalid instruments: effect estimation and bias detection through Egger regression, International Journal of Epidemiology.
  • Plataforma MR-Base/TwoSampleMR: Hemani et al. (2018), The MR-Base platform supports systematic causal inference across the human phenome, eLife.

Ha aprendido a inferir el efecto causal de cada variante genética individual. Ahora pasamos a una aplicación práctica que extiende este concepto: predecir el riesgo de enfermedad de un individuo mediante una sola puntuación que suma los efectos de cientos de miles de variantes.

En la siguiente entrega, S50, cubriremos el principio y las aplicaciones clínicas de la puntuación de riesgo poligénico (PRS, Polygenic Risk Score), que es la última entrega del nivel System S2.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...