Volver a la lista

Mapeo de eQTL: puntos en los que las variantes genéticas modifican la expresión y su especificidad tisular.

El mapeo de eQTL vincula las variantes causales identificadas por GWAS con los genes y tejidos específicos donde se altera la expresión. Se abordan desde los modelos de regresión cis-eQTL hasta el análisis de compartición y colocalización entre tejidos.

Avanzado
|
22min
|
Verificado (2026-07-29)
eQTLgene expressionGTExcolocalizationtissue specificity
Progreso0/120 (0%)

S44 Ya encontramos la variante causal, ¿y ahora qué?

En S44 (Fine-mapping), hemos reducido el conjunto creíble (credible set) a la variante causal estadísticamente más plausible dentro de un grupo de señales de GWAS. Sin embargo, la conclusión de que "este SNP es la variante causal" no es suficiente. Debemos saber qué cambia específicamente esa variante para influir en el riesgo de enfermedad.

Muchas variantes genéticas humanas no alteran la secuencia de proteínas, sino que se ubán en regiones reguladoras, como promotores y potenciadores (enhancers), modificando cuánto se expresa un gen. El mapeo de eQTL (locus de rasgos cuantitativos de expresión) es el proceso que cuantifica este vínculo. No obstante, la regulación génica funciona de manera distinta según el tejido: una misma variante puede aumentar la expresión en el hígado, pero no tener efecto alguno en el cerebro. El proyecto GTEx (Genotype-Tissue Expression) ha cartografiado a gran escala esta especificidad tisular en 49 tejidos.

En esta sección, derivamos los principios del modelo de regresión cis-eQTL, el método para medir la compartición de señales entre tejidos y la estadística bayesiana de colocalización, que comprueba si las señales de GWAS y eQTL "comparten la misma variante causal".

Modelo de regresión cis-eQTL y razonamiento conjunto entre tejidos

Modelo básico: regresión lineal donde el genotipo explica la expresión

Para un SNP jj cerca del gen gg (típicamente TSS ± 1Mb, ventana cis), la ecuación de regresión que explica la expresión normalizada yigy_{ig} del individuo ii mediante su genotipo xij{0,1,2}x_{ij} \in \{0,1,2\} es la siguiente:

yig=μ+xijβjg+Ciα+ϵiy_{ig} = \mu + x_{ij}\beta_{jg} + \mathbf{C}_i \boldsymbol{\alpha} + \epsilon_i

donde Ci\mathbf{C}_i es el vector de covariables que incluye el sexo, el PCA genómico y los factores PEER (covariables latentes extraídas de los datos que capturan no solo efectos de lote y variaciones técnicas ocultas en la expresión, sino también factores como la composición celular y el estado biológico). Para la expresión yigy_{ig} se utiliza un valor obtenido mediante la transformación normal inversa basada en rangos (INT), que ajusta los rangos entre individuos dentro de un gen a una distribución normal estándar. El objetivo es normalizar la distribución entre individuos para evitar que la asimetría (skewness) y los valores atípicos de la distribución de recuentos de lecturas (read counts) violen el supuesto de normalidad de la regresión; cabe notar que este valor por sí mismo no permite comparar directamente los niveles absolutos de expresión entre genes distintos.

Pruebas múltiples jeráricas: controlando la explosión de pares gen-SNP

Cada gen contiene miles de SNPs dentro de su ventana cis, y existen más de 20.000 genes. Aplicar la corrección de Bonferroni simple a todos los pares gen-SNP resulta excesivamente conservadora y puede hacer que se pierdan señales reales. El método utilizado por GTEx consta de dos etapas:

  1. Corrección intra-gen: Para cada gen, se calcula el p-value a nivel de gen pgp_{g} mediante una prueba de permutación que refleja el LD entre SNPs, o su aproximación mediante la distribución beta, basándose en el p-value del SNP más significativo dentro de la ventana cis.
  2. Corrección inter-gen: Se aplica el método de q-value (FDR) de Storey a los valores pgp_g para identificar los eGenes (genes con eQTL) significativos al nivel de FDR deseado (generalmente 5%).

Compartición de señales entre tejidos: la estadística π1\pi_1

Para medir si un eQTL significativo en el tejido A es una señal real en el tejido B (en lugar de simplemente no ser visible debido a una falta de potencia estadística), se estima la proporción π1=1π0\pi_1 = 1 - \pi_0 de la distribución de p-values del tejido B que corresponde a la hipótesis alternativa (π0\pi_0 es la "proporción de la verdadera hipótesis nula" estimada mediante el método de Storey). Un valor de π1\pi_1 cercano a 1 indica que la mayoría de las señales del tejido A también se manifiestan como no nulas en el tejido B, mientras que un valor bajo sugiere una regulación específica del tejido. Sin embargo, un π1\pi_1 alto no garantiza que el SNP causal y la dirección del efecto sean exactamente los mismos en ambos tejidos; este valor solo resume el grado de compartición de la señal, indicando que "esta señal no es casualidad". En las mediciones reales de GTEx, los pares de tejidos similares, como músculo y piel, tienden a mostrar un π1\pi_1 alto, mientras que los pares heterogéneos, como cerebro y sangre, tienden a mostrar valores bajos.

Colocalización: ¿Comparten las señales de GWAS y eQTL la "misma causa"?

Al extender el marco de los factores de Bayes (ABF) del S44, se puede probar si dos rasgos diferentes (un rasgo de GWAS y la expresión génica) comparten la misma variante causal. coloc(Giambartolomei et al., 2014) calcula el ABF para el rasgo 1 (aja_j) y el ABF para el rasgo 2 (bjb_j) para cada SNP jj dentro del locus, y luego asigna probabilidades posteriores a cinco hipótesis mutuamente excluyentes:

HipótesisSignificado
H0No hay variante causal para ninguno de los dos rasgos en este locus
H1Hay una variante causal solo para el rasgo 1
H2Hay una variante causal solo para el rasgo 2
H3Ambos rasgos tienen variantes causales, pero en diferentes SNPs
H4Ambos rasgos comparten el mismo SNP

Sum1=jaj,Sum2=jbj,Sum4=jajbj,Sum3=Sum1Sum2Sum4\text{Sum}_1 = \sum_j a_j, \quad \text{Sum}_2 = \sum_j b_j, \quad \text{Sum}_4 = \sum_j a_j b_j, \quad \text{Sum}_3 = \text{Sum}_1 \text{Sum}_2 - \text{Sum}_4

Al multiplicar las probabilidades a priori p1,p2,p12p_1, p_2, p_{12} (probabilidades a priori de que un SNP sea la variante causal para el rasgo 1, el rasgo 2 o ambos rasgos, respectivamente; los valores predeterminados de coloc son p1=p2=104p_1=p_2=10^{-4} y p12=105p_{12}=10^{-5}) y normalizar, se obtiene PP.H4\text{PP.H4} (probabilidad a posteriori de una variante causal compartida).

Ejemplo de cálculo manual: Obtención de PP.H4 en dos loci de SNP

Los siguientes números son ejemplos aritméticos simplificados para ilustrar el proceso de cálculo, no datos reales. Supongamos que, para dos loci de SNP, el ABF del rasgo 1 (GWAS) es a=[366.3,366.3]a = [366.3, 366.3] (situación en la que las señales GWAS de ambos SNPs no se distinguen estadísticamente) y el ABF del rasgo 2 (eQTL) es b=[500,2]b = [500, 2] (situación en la que el eQTL señala claramente al SNP1). En un análisis de coloc real, primero se debe verificar si los conjuntos de SNPs, el LD y la ascendencia de ambos rasgos están armonizados (harmonization); si un locus muestra un LD completo en un rasgo pero no en el otro, podría deberse a problemas en la combinación de variantes o en el control de calidad (QC), lo que requiere una verificación independiente.

Sum1=732.6,Sum2=502,Sum4=366.3×500+366.3×2=183,882.6\text{Sum}_1 = 732.6, \quad \text{Sum}_2 = 502, \quad \text{Sum}_4 = 366.3 \times 500 + 366.3 \times 2 = 183{,}882.6

Sum3=732.6×502183,882.6=183,882.6\text{Sum}_3 = 732.6 \times 502 - 183{,}882.6 = 183{,}882.6

Al calcular los valores no normalizados de cada hipótesis con las probabilidades a priori básicas:

H0:1,H1:104×732.6=0.0733,H2:104×502=0.0502H0: 1, \quad H1: 10^{-4} \times 732.6 = 0.0733, \quad H2: 10^{-4} \times 502 = 0.0502 H3:108×183,882.6=0.00184,H4:105×183,882.6=1.8388H3: 10^{-8} \times 183{,}882.6 = 0.00184, \quad H4: 10^{-5} \times 183{,}882.6 = 1.8388

Al dividir por la suma total de 2.96412.9641, obtenemos PP.H40.62\text{PP.H4} \approx 0.62 y PP.H00.34\text{PP.H0} \approx 0.34. Aunque Sum3 y Sum4 coinciden accidentalmente en su valor, la razón por la que PP.H4\text{PP.H4} es significativamente mayor que PP.H3\text{PP.H3} es que la probabilidad a priori cumple con p12(105)p1p2(108)p_{12}(10^{-5}) \gg p_1 p_2(10^{-8}); es decir, la "probabilidad a priori de que el mismo SNP sea la causa de ambos rasgos" se establece inicialmente en un valor mucho más alto que la "probabilidad a priori de que dos SNPs diferentes sean las causas, respectivamente". En este ejemplo, el PP.H4 es de 0.62, lo que inclina la balanza hacia una variante causal compartida, pero persiste un PP.H0 de 0.34, por lo que no es una conclusión definitiva.

Práctica en R: cálculo de PP.H4 mediante el método coloc

r
# Reproducir con código el ejemplo de cálculo de los dos primeros SNP
a <- c(366.3, 366.3)  # Rasgo 1 (GWAS) ABF
b <- c(500, 2)        # Rasgo 2 (eQTL) ABF
p1 <- 1e-4; p2 <- 1e-4; p12 <- 1e-5

sum1 <- sum(a); sum2 <- sum(b); sum4 <- sum(a * b); sum3 <- sum1 * sum2 - sum4

unnorm <- c(
  H0 = 1,
  H1 = p1 * sum1,
  H2 = p2 * sum2,
  H3 = p1 * p2 * sum3,
  H4 = p12 * sum4
)

pp <- unnorm / sum(unnorm)
print(round(pp, 4))

Correspondencia de conceptos

  • Inferencia conjunta bayesiana (colocalización): Determinar si dos evidencias independientes (GWAS y eQTL) comparten una misma causa subyacente es análogo a un problema de fusión de sensores (sensor fusion), donde se busca determinar si diferentes registros de sensores provienen del mismo evento fundamental.
  • Extracción de factores latentes (factores PEER): Extraer efectos de lote y variaciones técnicas desconocidas a partir de datos observados mediante aprendizaje no supervisado sigue el mismo principio que la estimación de variables latentes mediante PCA o análisis factorial.
  • Pruebas múltiples jerárquicas: La estructura de dos etapas, que aplica una corrección intra-génica y luego un FDR inter-génico, es idéntica al problema de comparaciones múltiples jerárquicas en datos con estructura de árbol, donde se separa la corrección dentro de los subgrupos de la corrección entre grupos.

Problemas comunes

  • Sobreaplicación de factores PEER: Incluir demasiadas covariables puede provocar la eliminación de señales verdaderas de eQTL (sobrecorrección). GTEx proporciona una guía para determinar el número de factores PEER en proporción al tamaño de la muestra.
  • Confusión entre eQTL trans y cis: Los eQTL cis (regulación cercana) y los eQTL trans (regulación a distancia o en otros cromosomas) tienen potencias estadísticas y cargas de pruebas múltiples completamente diferentes. Los eQTL trans implican un número mucho mayor de pares de pruebas, por lo que requieren una corrección mucho más estricta.
  • Uso de la probabilidad a priori de colocalización sin ajustarla a los datos: p12=105p_{12}=10^{-5} es un valor predeterminado común, pero no es un estándar absoluto aplicable a todos los loci. En regiones con alta densidad génica o bloques de LD fuertes, se debe verificar la estabilidad de las conclusiones ante cambios en la probabilidad a priori mediante un análisis de sensibilidad.

Para profundizar

Este texto ha sido reestructurado directamente por el equipo de investigación de BPD. Para profundizar, consulte los artículos originales y los materiales oficiales.

  • Artículo principal del Consorcio GTEx: GTEx Consortium (2020), The GTEx Consortium atlas of genetic regulatory effects across human tissues, Science, 369(6509):1318–1330.
  • Artículo original de coloc: Giambartolomei et al. (2014), Bayesian Test for Colocalisation between Pairs of Genetic Association Studies Using Summary Statistics, PLOS Genetics, 10(5):e1004383. (El modelo original coloc.abf asume que cada rasgo tiene como máximo una variante causal dentro de la región analizada; para loci con múltiples señales, se requieren extensiones combinadas con fine-mapping, como coloc.susie).
  • Artículo original de METASOFT: Han & Eskin (2011), Random-Effects Model Aimed at Discovering Associations in Meta-Analysis of Genome-wide Association Studies, American Journal of Human Genetics, 88(5):586–598.
  • GTEx Portal: gtexportal.org — ofrece gratuitamente estadísticas resumidas de eQTL y visualización de la expresión por tejido.

Se ha vinculado qué variante causal altera la expresión de qué gen en qué tejido. Ahora, dejando atrás la perspectiva de los SNP individuales, es momento de examinar cómo la estructura de ancestría y la mezcla (admixture) entre poblaciones afectan a todos estos análisis a nivel genómico.

En la siguiente entrega, S46, abordaremos los fundamentos de la genética de poblaciones con PLINK y ADMIXTURE: la estimación de la composición ancestral y la prueba de equilibrio de Hardy-Weinberg.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...