Volver a la lista

Determinación de haplotipos e imputación: ¿Cómo completan los datos faltantes Beagle y Minimac?

Se explica cómo imputar variantes perdidas en la secuenciación de baja cobertura utilizando paneles de referencia poblacional, por qué el haplotipo paging es esencial para los GWAS y en qué se diferencian Beagle y Minimac.

Avanzado
|
20min
|
Verificado (2026-07-22)
haplotype phasingimputationreference panel
Progreso0/120 (0%)

¿Por qué el haplotipado y la imputación son etapas separadas?

En las entregas anteriores, hemos llamado correctamente los genotipos por locus (0/0, 0/1, 1/1). Sin embargo, solo con estos genotipos falta información.

En primer lugar, información de haplotipo. La notación 0/1 indica que hay un alelo de referencia y uno alternativo en este locus, pero no nos dice cuáles combinaciones están en el mismo cromosoma. Por ejemplo: si ambos loci son 0/1, no sabemos si la combinación es (referencia·referencia + alternativo·alternativo) o (referencialternativo + alternativo·referencia). Determinar esto se denomina faseo (phasing) = haplotipado.

En segundo lugar, relleno de valores faltantes. La secuenciación de baja cobertura (por ejemplo, 4×) o los microarrays solo observan algunos loci del genoma. Los loci restantes son faltantes. Sin embargo, utilizando las estadísticas de paneles de referencia poblacional (como TOPMed), es posible imputar probabilísticamente los genotipos en los loci faltantes adyacentes a los observados. Esto se denomina imputación.

Ambas tareas se basan en HMM y, en la práctica, las realiza la misma herramienta.

Beagle — faseo e imputación integrados

Herramienta desarrollada por Brian Browning en la Universidad de Washington. Ha estado en mantenimiento durante más de 20 años y actualmente está en la versión v5.5.

Principio

Una oración para captar la idea central.

Utilizar los haplotipos conocidos del panel de referencia como estados de un HMM y determinar probabilísticamente de qué combinación provienen los genotipos de las nuevas muestras.

Analicemos el concepto mediante una fórmula. Si asumimos que hay K haplotipos en el panel de referencia, se supone que los dos haplotipos de cada muestra provienen de uno de los K (o de su recombinación). El estado del HMM es K y la observación son los genotipos por locus. Se entrena con Baum-Welch y se calcula la probabilidad condicional en cada locus mediante el algoritmo Forward-Backward.

Con este principio, se realizan ambas tareas simultáneamente:

  • Loci faltantes: El HMM los rellena mediante el enlace (linkage) con los loci observados adyacentes.
  • Faseo: La secuencia de estados del HMM corresponde directamente a la pertenencia al haplotipo.

Comando de ejecución

bash
java -Xmx16g -jar beagle.jar \
gt=input.vcf.gz \
ref=1000GP_chr22.bref3 \
map=plink.chr22.GRCh38.map \
out=output_chr22
  • gt: VCF de entrada (genotipos observados de las muestras).
  • ref: Panel de referencia (formato propio de Beagle .bref3).
  • map: Mapa genético (tasas de recombinación).
  • out: Prefijo de los resultados.

Los paneles de referencia humanos incluyen 1000 Genomes, HRC y TOPMed. TOPMed (+90.000 haplotipos) ofrece la mayor sensibilidad.

Puntos fuertes

  • Paginación e imputación con una sola herramienta: simplifica el flujo de trabajo.
  • Larga estabilidad: validado durante 20 años.
  • Gratuito tanto para uso no comercial como comercial.

Puntos débiles

  • Velocidad frente a Minimac4: en cohortes grandes, Minimac4 es de 3 a 5 veces más rápido.
  • Complejidad en la implementación del panel de referencia: es necesario convertir las referencias al formato propio (.bref3).

Minimac4 — Imputación para la era de la nube

Herramienta desarrollada por la Universidad de Míchigan. Es el motor detrás de Michigan Imputation Server.

Principio

Similar a Beagle en su uso de un HMM, pero con un panel de referencia comprimido en formato M3VCF, lo que mejora la eficiencia de memoria y favorece el procesamiento paralelo en cohortes grandes.

Comando de ejecución

bash
minimac4 \
--refHaps HRC.r1-1.EGA.GRCh38.chr22.haplotypes.m3vcf.gz \
--haps eagle_phased.vcf.gz \
--prefix imputed_chr22 \
--cpus 8 \
--format GT,DS,GP

Minimac4 no realiza el paso de phasing. Por lo tanto, se debe realizar primero el phasing con herramientas especializadas (como Eagle o SHAPEIT) y luego introducir el VCF resultante en Minimac4.

Fortalezas

  • Velocidad: Se desempeña bien en cohortes a gran escala.
  • Michigan Imputation Server: Ofrece un servicio gratuito mediante una interfaz web (https://imputationserver.sph.umich.edu/). Solo es necesario cargar su propio VCF y el servidor realizará la imputación.

Debilidades

  • Requiere phaseo por separado.

Eagle · SHAPEIT — Especializados en phasing

Estas dos herramientas son el estándar para el phasing a gran escala.

  • Eagle2: Del Broad Institute. Optimizado específicamente para paneles de referencia HRC. Es el estándar en genética de poblaciones.
  • SHAPEIT4: De la Universidad de Oxford. Compatible con diversos paneles de referencia.
bash
eagle \
--vcfTarget=input.vcf.gz \
--vcfRef=hrc_ref.vcf.gz \
--geneticMapFile=genetic_map_hg38.tsv \
--outPrefix=phased \
--numThreads=8

Insert this resulting VCF into Minimac4.

Practical Decision Rules

SituationChoice
Small cohort (<1000)Beagle (simplicity)
Large cohort (tens of thousands to hundreds of thousands)Eagle → Minimac4
Convenient web serviceMichigan Imputation Server (Eagle + Minimac4 server)
UK Biobank · TOPMed-style projectSHAPEIT4 → Minimac4
Small-scale clinical validationBeagle

Reference Panel — Which One to Use?

Imputation accuracy depends critically on the size and diversity of the reference panel.

Reference PanelNumber of HaplotypesPopulationAccess
1000 Genomes Phase 35,008Multi-ethnicCompletely free
HRC r1.164,976European-biasedSanger Imputation Service
TOPMed Freeze 8194,512Multi-ethnicMichigan Imputation Server
UK Biobank500,000+BritishApproval required

TOPMed is currently the standard due to its excellent scale and diversity. It can be accessed for free via the Michigan Imputation Server.

Manual Calculation — What Imputation Actually Does

Hypothetical scenario. Individual A's SNP array observes 100 positions on chr22. We want to fill in the 10,000 missing positions between them.

  • In the reference panel, A's observed 100 positions match reference haplotype h_123 with 90/100 agreement and h_456 with 85/100 agreement.
  • The HMM learns that A's two haplotypes likely originated from approximately (h_123, h_456).
  • For the remaining 10,000 missing positions, we refer to what h_123 and h_456 state at those locations → fill with those values.
  • Assign a probability (DS = dosage, 0–2) and an accuracy metric (R²) to each filled value.

After this probabilistic filling, these imputed genotypes are used in GWAS testing as if they were observed.

Imputation Accuracy — R²

Each imputed SNP is assigned an R² (expected accuracy, 0–1).

  • R² ≥ 0.8: High quality. Use for GWAS.
  • R² 0.3–0.8: Medium quality. Apply downstream filtering.
  • R² < 0.3: Low quality. Mostly discard.

R² depends heavily on minor allele frequency (MAF). Rare variants with MAF of 0.001 are difficult to impute.

How to Use the Michigan Imputation Server

This is the most practical approach.

  1. Split the VCF by chromosome.
  2. Select a reference panel in the server's web interface (TOPMed recommended).
  3. Select phasing tool (Eagle recommended).
  4. Espere unas horas tras la carga del VCF.
  5. Descargue los resultados (VCF imputado + informe INFO).

Es mucho más cómodo que instalar y mantener Beagle o Minimac4 en un servidor de laboratorio. Si la privacidad de los datos es un problema, ejecute localmente.

¿Por qué son esenciales el haplotipado y la imputación para GWAS?

Nos encontraremos con ello nuevamente en GWAS (S42).

  • Potencia de detección: con solo 100 SNP observados, se pueden pasar por alto señales asociadas cerca de un gen específico.
  • Al expandir a 1M~30M SNP imputados, se acerca más a la variante causal.
  • Metaanálisis: aunque varios estudios utilicen diferentes arrays o métodos de secuenciación, tras la imputación pueden integrarse en un conjunto común de SNP.

Por esta razón, la imputación es un paso esencial en los pipelines de GWAS.

Práctica pequeña con Colab

bash
!apt-get install -y openjdk-17-jre-headless >/dev/null
!wget -q https://faculty.washington.edu/browning/beagle/beagle.jar
!java -Xmx4g -jar beagle.jar --help 2>&1 | head -20

Como el panel de referencia completo es grande, puede demostrarse la ejecución con una pequeña sección del cromosoma 22.

Mapeo CS

  • Forward-Backward de HMM: calcula la probabilidad posterior condicional en cada posición (M19).
  • Correspondencia con el panel de referencia: el espacio de estados del HMM tiene K estados, donde K es el número de haplotipos de referencia.
  • Imputación por probabilidad condicional: en una posición ausente, el valor esperado de la distribución posterior es la dosis.

Consulte el episodio de DryBench «Patrones de inferencia con HMM» (hmm-inference-patterns).

Conclusión

La imputación es una técnica extraordinariamente potente. Completa probabilísticamente las posiciones con observaciones insuficientes mediante datos poblacionales y aumenta de forma considerable la potencia de los GWAS y los análisis posteriores. En el siguiente episodio (S17) concluiremos el pipeline de ADN y entraremos en la cuantificación de RNA-seq para ver cómo el pseudoalineamiento de Salmon y kallisto evita realizar el alineamiento completo.

Para profundizar

  • Browning B.L. et al. (2018), A one-penny imputed genome from next-generation reference panels. American Journal of Human Genetics 103:338. Escalabilidad de Beagle 5.
  • Das S. et al. (2016), Next-generation genotype imputation service and methods. Nature Genetics 48:1284. Artículo original de Minimac4 y Michigan Imputation Server.
  • Loh P.R. et al. (2016), Reference-based phasing using the Haplotype Reference Consortium panel. Nature Genetics 48:1443. Artículo original de Eagle.
  • Delaneau O. et al. (2019), Accurate, scalable and integrative haplotype estimation. Nature Communications 10:5436. SHAPEIT4.
  • Michigan Imputation Server (https://imputationserver.sph.umich.edu/): servicio gratuito de imputación.

Comprender intuitivamente por qué la imputación aumenta la potencia estadística facilitará mucho el episodio sobre GWAS (S42). En el siguiente episodio pasaremos a la cuantificación de RNA-seq.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...