Tras observar la variante S48, ahora preguntamos: "¿Es realmente la causa?"
Hasta ahora hemos localizado variantes (GWAS), las hemos reducido a variantes causales verdaderas (fine-mapping) y las hemos conectado con los genes cuya expresión alteran (eQTL). Sin embargo, todo este análisis sigue siendo un estudio observacional. El hecho de observar una correlación —"las personas con colesterol LDL alto tienen más probabilidades de desarrollar enfermedades cardíacas"— no permite concluir directamente que reducir el LDL disminuirá la incidencia de enfermedades cardíacas, ya que podría haber variables de confusión (confounder) que afecten a ambos factores, como el tabaquismo, la falta de ejercicio o los hábitos alimenticios.
La aleatorización mendeliana (MR, Mendelian Randomization) esquiva este problema aprovechando una propiedad especial de la genética. La herencia de un alelo específico de los padres se determina mediante la segregación aleatoria durante la meiosis en el momento de la fecundación; por esta razón, a menudo se compara con una asignación aleatoria realizada por la naturaleza antes del nacimiento (aunque volveremos a señalar más adelante que esta analogía no es perfecta). En esta sección, derivaremos los principios estadísticos de la MR para inferir relaciones causales utilizando variantes genéticas como variables instrumentales, y al final examinaremos cómo se aplica a la farmacogenómica dirigida a dianas (drug-target MR).
Supuestos fundamentales de las variables instrumentales y estimación IVW
Los tres supuestos necesarios para que una variable instrumental sea válida
Para utilizar una variante genética como variable instrumental e inferir la relación causal entre la variable de exposición (por ejemplo, el colesterol LDL) y la variable de resultado (por ejemplo, las enfermedades cardíacas), se requieren las siguientes tres condiciones:
- Relevancia: debe estar fuertemente asociada con (, una condición ya confirmada en los estudios GWAS).
- Independencia: debe ser independiente de las variables que confunden la relación entre e . Aunque la segregación aleatoria durante la meiosis proporciona el fundamento teórico, en los datos reales este supuesto puede violarse debido a la estratificación poblacional, el apareamiento selectivo (assortative mating), los efectos genéticos indirectos de la generación parental (dynastic effect) y sesgos de supervivencia o selección, por lo que se requieren verificaciones adicionales.
- Restricción de exclusión: debe afectar a únicamente a través de . Si influye directamente en mediante otras vías independientes de (pleiotropía horizontal), este supuesto se viola.
Estimador de la razón de Wald: estimación del efecto causal con una sola variante
Si se obtienen el efecto de sobre , , y el efecto de sobre , , respectivamente, de los GWAS correspondientes, la estimación del ratio de Wald para el efecto causal de es la siguiente.
Esto implica calcular a posteriori cuánto cambia cuando modifica en una unidad, mediante la proporción de los efectos que tiene sobre cada variable. Si y se estimaron en muestras distintas (independientes), esto se denomina MR de dos muestras (Two-sample MR). El hecho de que solo sean necesarios estadísticos resumidos es una ventaja práctica de este método, pero el "uso de estadísticos resumidos" no define el diseño de dos muestras: también es posible realizar MR con estadísticos resumidos obtenidos de la misma muestra (one-sample), caso en el cual persiste un problema de sesgo derivado de la superposición de muestras.
Estimación IVW ponderada por inversa de varianza para combinar múltiples variantes
Dado que una sola variante produce estimaciones inestables, se combinan los ratios de Wald de múltiples variables instrumentales independientes (sin LD). El estimador ponderado por inversa de varianza (IVW, Inverse-Variance Weighted) equivale a una regresión por mínimos cuadrados ponderados que pasa por el origen.
Los pesos se asignan con mayor magnitud cuanto mayor es el efecto de la variante sobre y cuanto menor es el error estándar de la estimación del efecto sobre (es decir, mayor precisión), otorgando así mayor influencia a las variantes más confiables.
Ejemplo de cálculo manual: Estimación del efecto causal IVW con 3 variantes
Supongamos que los tamaños de efecto de exposición y resultado para tres SNPs son los siguientes.
| SNP | |||
|---|---|---|---|
| 1 | 0.20 | 0.08 | 0.020 |
| 2 | 0.15 | 0.06 | 0.030 |
| 3 | 0.30 | 0.11 | 0.025 |
Calcule el ratio de Wald y el peso para cada SNP.
El hecho de que las tres estimaciones puntuales (0,400, 0,400 y 0,367) no difieran significativamente entre sí y converjan hacia la estimación IVW (0,382) es una señal positiva; si un solo SNP mostrara una estimación puntual notablemente diferente, debería sospecharse que dicho SNP viola el supuesto de exclusión y podría ser una variante pleiotrópica.
MR-Egger: Prueba de intercepción para detectar pleiotropía
IVW asume que el supuesto de exclusión se cumple en todas las variantes. La regresión MR-Egger (Bowden et al., 2015) realiza una regresión de sobre sin forzar que la intercepción sea cero, para probar si esta se desvía significativamente de cero. Una intercepción distinta de cero indica que las variantes afectan a directamente fuera de la vía de , lo cual es evidencia de pleiotropía direccional.
Práctica en R: Replicación de la estimación IVW
# Repetición del ejemplo de cálculo de 3-SNP en código
beta_gx <- c(0.20, 0.15, 0.30)
beta_gy <- c(0.08, 0.06, 0.11)
se_gy <- c(0.020, 0.030, 0.025)
wald_ratio <- beta_gy / beta_gx
weight <- beta_gx^2 / se_gy^2
ivw_estimate <- sum(weight * wald_ratio) / sum(weight)
cat("Relación de Wald por SNP:", round(wald_ratio, 4), "\n")
cat("Peso por SNP:", round(weight, 2), "\n")
cat(sprintf("Estimación del efecto causal IVW: %.4f\n", ivw_estimate))
# Prueba de intersección MR-Egger: beta_gy ~ beta_gx (mínimos cuadrados ponderados, con intersección)
# Nota: Los pesos de la regresión de Egger no son el peso a escala de razón del IVW(beta_gx^2/se_gy^2), sino
# 1/se_gy^2 — separamos en variables distintas para no confundir los dos pesos.
# (Además, con 3 SNPs para estimar intersección y pendiente, quedan solo 1 grado de libertad residual,
# por lo que la prueba de significancia de la intersección en este ejemplo tiene poco más valor que una demostración educativa.)
egger_weight <- 1 / se_gy^2
egger_fit <- lm(beta_gy ~ beta_gx, weights = egger_weight)
cat("Intersección MR-Egger (señal pleiotrópica):", round(coef(egger_fit)[1], 5), "\n")Mapeo de MR
- Variables instrumentales (Instrumental Variables): Calcular el efecto causal a través de una variable exógena que no se ve afectada por variables de confusión tiene una estructura matemáticamente idéntica al método de mínimos cuadrados en dos etapas (2SLS) de la econometría.
- Mínimos cuadrados ponderados (Weighted Least Squares): El estimador IVW es un caso especial que aplica la técnica estándar de regresión, que asigna mayor peso a las observaciones con mayor precisión, a una regresión que pasa por el origen.
- Verificación de robustez (Robustness Check): Realizar pruebas separadas para señales que solo aparecen cuando se violan los supuestos clave, como la prueba de intersección de MR-Egger, y así validar cruzadamente la confianza en el estimador principal, refleja el mismo enfoque que verificar por separado los casos límite en las pruebas de software.
Defectos comunes
- Uso de variables instrumentales débiles (Weak Instrument): Si se utiliza una variante con un estadístico F bajo (convencionalmente menor de 10) como instrumento, aunque sea estadísticamente significativo, se produce sesgo por variable instrumental débil. La dirección del sesgo depende del diseño del estudio: en el MR de una sola muestra (one-sample), donde las muestras de exposición y resultado se superponen, tiende a sesgarse hacia la dirección de la asociación observada confundida; en el MR de dos muestras (two-sample), donde se estiman exposición y resultado en dos muestras independientes, generalmente se debilita hacia la hipótesis nula.
- No identificación de LD entre variables instrumentales: Tratar variantes de SNP fuertemente asociadas (alto LD) como variables instrumentales independientes provoca el cálculo duplicado de la misma señal y una subestimación de la varianza. Deben seleccionarse solo variantes independientes mediante clumping.
- Informar solo los resultados de IVW y omitir análisis de sensibilidad: Si los estimadores de varios métodos de análisis de sensibilidad, como MR-Egger, mediana ponderada (weighted median) y MR-PRESSO, difieren considerablemente entre sí, es probable que exista pleiotropía. Es peligroso sacar conclusiones basándose únicamente en IVW.
Drug-target MR: Aplicación a la genética de dianas farmacológicas
Si tratado hasta ahora ha sido una variable de exposición general como el colesterol LDL, en el drug-target MR se coloca en la posición de exposición la expresión o actividad de la proteína diana de un fármaco específico (por ejemplo, los niveles de la proteína PCSK9 medidos mediante eQTL y pQTL). Al estimar el efecto causal que las variantes genéticas que reducen dicha proteína tienen sobre un rasgo de resultado (por ejemplo, el riesgo de enfermedad cardíaca), se puede anticipar si un fármaco que inhibe esa diana podría tener efectos antes de los ensayos clínicos; de hecho, el desarrollo de inhibidores de PCSK9 se cita a menudo como un caso respaldado por esta evidencia genética previa. No obstante, aunque se aplican directamente los principios de IVW y MR-Egger, en la genética de dianas farmacológicas son adicionales los siguientes aspectos importantes:
- Agrupar varios SNPs de la ventana cis como variables instrumentales sin verificar la colocalización (ver S45) para confirmar si la exposición y el resultado comparten la misma variante causal puede llevar a conclusiones causales erróneas, ya que variantes distintas podrían mezclarse por azar.
- El efecto acumulado de las variantes genéticas a lo largo de toda la vida y el efecto de tomar un medicamento durante un breve período en la edad adulta pueden diferir en magnitud y patrón; no se debe trasladar directamente una estimación de MR como "tomar este medicamento tendrá exactamente este efecto".
Para profundizar más
El texto principal ha sido reescrito por el equipo de investigación del BPD. Profundice consultando el artículo original y la documentación oficial.
- Artículo fundacional sobre el concepto de MR: Davey Smith & Ebrahim (2003), 'Mendelian randomization': can genetic epidemiology contribute to understanding environmental determinants of disease?, International Journal of Epidemiology.
- Artículo sobre la metodología IVW: Burgess, Butterworth & Thompson (2013), Mendelian Randomization Analysis With Multiple Genetic Variants Using Summarized Data, Genetic Epidemiology.
- Artículo original de MR-Egger: Bowden, Davey Smith & Burgess (2015), Mendelian randomization with invalid instruments: effect estimation and bias detection through Egger regression, International Journal of Epidemiology.
- Plataforma MR-Base/TwoSampleMR: Hemani et al. (2018), The MR-Base platform supports systematic causal inference across the human phenome, eLife.
Ha aprendido a inferir el efecto causal de cada variante genética individual. Ahora pasamos a una aplicación práctica que extiende este concepto: predecir el riesgo de enfermedad de un individuo mediante una sola puntuación que suma los efectos de cientos de miles de variantes.
En la siguiente entrega, S50, cubriremos el principio y las aplicaciones clínicas de la puntuación de riesgo poligénico (PRS, Polygenic Risk Score), que es la última entrega del nivel System S2.