S46 La región génica más polimórfica en la estructura ancestral
En S46 se abordó la estructura ancestral a nivel de todo el genoma. Ahora, dirigimos la atención hacia una región específica del cromosoma 6, dentro del MHC (Complejo Mayor de Histocompatibilidad, Major Histocompatibility Complex), centrándonos en los genes HLA (Antígeno Leucocitario Humano, Human Leukocyte Antigen). Las HLA son moléculas que permiten a las células inmunitarias distinguir "si este fragmento celular corresponde a una proteína normal del propio cuerpo o al producto de un patógeno invasor o de una célula cancerosa". Por ello, diversas enfermedades autoinmunes, el rechazo de trasplantes de órganos y la susceptibilidad a ciertos efectos secundarios de fármacos e infecciones están fuertemente asociados con los genes HLA.
El problema radica en que HLA es la región más polimórfica (polymorphic) del genoma humano. Solo para el gen HLA-B existen miles de alelos conocidos, y la nomenclatura se subdivide en números de cuatro dígitos como HLA-A*02:01. Las lecturas de secuenciación cortas tienden a mapearse incorrectamente hacia parálogos erróneos en esta región altamente polimórfica, y los conjuntos de datos estándar de SNP no pueden medir directamente los alelos HLA de cuatro dígitos desde el inicio.
En este capítulo se abordan las razones estructurales por las que la secuenciación de HLA es difícil, los enfoques de las herramientas de tipado directo basadas en NGS y los principios bayesianos de la imputación (imputation) para inferir alelos HLA únicamente a partir de datos de conjuntos de SNP.
Las dificultades del tipado HLA y los principios bayesianos de la imputación
Por qué fallan las lecturas cortas: hipervariedad y mapeo cruzado entre parálogos
Los genes de clase I de HLA (A, B, C) presentan una alta similitud de secuencia entre sí, y las diferencias en las secuencias de alelos entre individuos son mucho mayores que en otras regiones génicas. Al alinear con un único genoma de referencia estándar, surge el problema del mapeo cruzado (cross-mapping), donde resulta ambiguo "de qué gen y de qué alelo provino la lectura".
- OptiType (Szolek et al., 2014) resuelve este problema mediante programación lineal entera (ILP, Integer Linear Programming). Mediante optimización de programación lineal entera, busca el par de alelos que mejor explica todas las lecturas observadas y que no es contradictorio entre sí, dentro de las posibles combinaciones de alelos.
- HLA*LA (Dilthey et al., 2019) alinea las lecturas en un grafo de referencia (reference graph) que incluye todos los alelos conocidos, en lugar de una única referencia lineal, reduciendo estructuralmente la posibilidad de que ocurra mapeo cruzado desde el inicio.
Inferencia de alelos HLA únicamente a partir de conjuntos de SNP: Imputación
En cohortes grandes (como GWAS) que solo tienen datos de array de SNPs de bajo costo, sin secuenciación del genoma completo ni del exoma, se infieren indirectamente los alelos HLA aprovechando el fuerte desequilibrio de ligamiento (LD) entre los SNPs cercanos a la región HLA y los alelos HLA de cuatro dígitos. Herramientas como SNP2HLA (Jia et al., 2013) y HIBAG (Zheng et al., 2014) utilizan este enfoque.
La idea central es el teorema de Bayes. Si denotamos el patrón observado de SNPs circundantes como y los alelos HLA candidatos como , entonces:
donde es la frecuencia previa del alelo en la población estimada a partir del panel de referencia, y es la probabilidad condicional de que las personas con ese alelo presenten este patrón de SNPs según el panel de referencia (si el LD es fuerte, se acerca a 1; si el LD es débil, se distribuye uniformemente entre varios alelos). HIBAG no calcula esto mediante un único clasificador, sino que aumenta la estabilidad de la predicción utilizando un conjunto de bagging de atributos (attribute bagging): selecciona aleatoriamente subconjuntos de SNPs para entrenar múltiples clasificadores débiles y luego promedia sus resultados.
Ejemplo de cálculo manual: Obtención de la probabilidad posterior del alelo HLA-A a partir de un patrón de SNP
Supongamos que las frecuencias previas en la población son , y la suma de todos los demás alelos es . Supongamos que para un individuo, las probabilidades condicionales de observar el patrón de SNPs circundantes en el panel de referencia para cada grupo son , y (debido al fuerte LD con A*02:01 y un LD débil con los demás).
Dado que la constante de normalización es , obtenemos:
Este individuo tiene una probabilidad posterior de aproximadamente el 80% para A*02:01, siendo la más alta; por lo tanto, se imputa como ese alelo. El punto clave es que, aunque las frecuencias previas sean similares, si hay una gran diferencia en las probabilidades condicionales (la fuerza del LD), las probabilidades posteriores divergen significativamente, y el resultado de la imputación se presenta como un valor de probabilidad (probabilidad posterior), es decir, no con certeza absoluta sino como un nivel de confianza.
Aquí, para simplificar los cálculos, solo abordamos "a qué categoría de alelo pertenece una sola copia cromosómica". En realidad, las personas tienen dos alelos en el locus HLA-A, heredados de ambos padres, por lo que las herramientas prácticas como HIBAG y SNP2HLA extienden este cálculo bayesiano para inferir conjuntamente la probabilidad posterior del diplotype (genotipo diploide) o el dosage por alelo (0/1/2).
Práctica en R: Cálculo de la probabilidad posterior del alelo HLA bayesiano
# Reproducción en código del ejemplo de cálculo manual anterior
prior <- c(A0201 = 0.28, A0101 = 0.15, other = 0.57)
likelihood <- c(A0201 = 0.9, A0101 = 0.05, other = 0.1)
unnorm <- prior * likelihood
posterior <- unnorm / sum(unnorm)
print(round(posterior, 4))
# Ejemplo de aplicación del umbral de confianza de imputación: solo se adoptan alelos con posterior >= 0.5
best_call <- names(posterior)[which.max(posterior)]
cat(sprintf("Llamada final: %s (probabilidad posterior %.3f)\n", best_call, max(posterior)))Mapeo de CS
- Clasificación bayesiana (Bayesian Classification): Combinar la evidencia observada (patrones de SNP) con el conocimiento previo (frecuencias del panel de referencia) para seleccionar la categoría más plausible constituye el marco básico de los problemas de clasificación que utilizan el teorema de Bayes (sin embargo, no se asume que "los SNPs sean independientes entre sí" como en el caso de Naive Bayes; la imputación real de HLA se basa fundamentalmente en aprovechar la estructura de LD y haplotipos entre los SNPs).
- Aprendizaje por conjuntos (Attribute Bagging): El hecho de que HIBAG entrene varios clasificadores para cada subconjunto parcial de SNPs y promedie sus resultados sigue el mismo principio que Random Forest, que crea múltiples árboles de decisión a partir de subconjuntos parciales de características (features) para reducir la varianza.
- Programación entera (ILP): El hecho de que OptiType resuelva la compatibilidad entre alelos y lecturas como un problema de programación entera para encontrar la solución óptima es una formulación estándar de optimización combinatoria que optimiza una función objetivo bajo condiciones de restricción.
Defectos comunes encontrados
- Confundir resultados de baja resolución (2 dígitos) con alta resolución (4 dígitos): Algunas imputaciones basadas en alineamiento solo llaman de manera estable hasta el nivel de 2 dígitos (por ejemplo, A*02) cuando la confianza es baja. Para conclusiones clínicas a nivel de 4 dígitos (como alelos específicos asociados con riesgo de efectos secundarios a fármacos), es imprescindible verificar las probabilidades posteriores y la coincidencia de la población del panel de referencia.
- Incompatibilidad de poblaciones entre el panel de referencia y la cohorte objetivo: Las frecuencias de los alelos HLA y la estructura de LD varían enormemente según la población. Si se aplica directamente un modelo entrenado con un panel de referencia de ascendencia europea a una cohorte de ascendencia asiática oriental, las probabilidades posteriores caerán a niveles no confiables.
- Tratar los resultados del tipado directo por NGS y la imputación con la misma confianza: El tipado basado en secuenciación directa (OptiType, HLA*LA) se basa en evidencia de secuencia real, mientras que la imputación es una inferencia indirecta basada en LD. En situaciones que requieren un diagnóstico definitivo (como trasplantes de órganos), las pruebas dirigidas, SBT y NGS de alta resolución realizadas en laboratorios clínicos certificados son el estándar; no se deben equiparar las llamadas basadas en WGS/WES del software de investigación con estas.
Para profundizar más
El texto ha sido reescrito directamente por el equipo de investigación de BPD. Para profundizar, consulte los artículos originales y la documentación oficial.
- Artículo original de OptiType: Szolek et al. (2014), OptiType: precision HLA typing from next-generation sequencing data, Bioinformatics.
- Artículo original de HLA*LA: Dilthey et al. (2019), HLA*LA: HLA typing from linearly projected graph alignments, Bioinformatics, 35(21):4394–4396.
- Artículo original de HIBAG: Zheng et al. (2014), HIBAG—HLA genotype imputation with attribute bagging, The Pharmacogenomics Journal.
- Artículo original de SNP2HLA: Jia et al. (2013), Imputing Amino Acid Polymorphisms in Human Leukocyte Antigens, PLOS ONE.
Si se abordaron las variantes a nivel de SNP tan densas como en HLA, ahora pasamos al extremo opuesto — las grandes variantes estructurales, donde fragmentos completos del genoma se invierten o desaparecen.
En el siguiente capítulo S48, se tratará cómo detectar y visualizar grandes variantes cromosómicas como translocaciones, inversiones y CNV.