Volver a la lista

Herramienta que explica el significado de cada línea de un archivo VCF: anotación de variantes con Ensembl VEP

Aquí se aborda cómo cada línea del VCF llamado con GATK4·PanVariants afecta a las proteínas, mediante la interpretación de los resultados de Ensembl VEP y un taller práctico sobre la REST API.

Intermedio
|
20min
|
Verificado (2026-07-29)
variant effect predictionconsequence termsVEP REST API
Progreso0/120 (0%)

El VCF solo proporciona coordenadas, no el significado

El producto final del pipeline de GWAS y llamado de variantes tratado en S42~S50 y F32 es, en última instancia, un VCF. Una línea de VCF solo contiene información de coordenadas, como "en qué cromosoma y en qué posición la A cambió a G", pero no indica cómo afecta ese cambio a la función proteica. Ensembl VEP (Variant Effect Predictor) es una herramienta que aplica estas coordenadas a un modelo genético para traducirlas en un significado funcional.

Principio — Aplicar coordenadas a la estructura genética

Procedimiento para determinar la consecuencia de la variante (consequence)

VEP superpone las coordenadas de la variante con el modelo de transcritos (límites de exón, intrón y UTR). Si la variante cae en la región codificante de un exón, calcula cómo cambia ese codón para determinar el cambio de aminoácico; si cae en regiones intrónicas, de promotor o intergénicas, le asigna la terminología estándar correspondiente. Estos términos no se han definido arbitrariamente, sino que siguen un sistema de vocabulario común llamado Sequence Ontology (SO); por ejemplo, missense_variant(sustitución que cambia el aminoácido), stop_gained(creación de un codón de terminación prematura), synonymous_variant(sustitución sinónima donde el aminoácido permanece igual), etc.

Grado de IMPACT — Reglas para establecer prioridades

VEP asigna un nivel de impacto (IMPACT) de 4 etapas, HIGH·MODERATE·LOW·MODIFIER, a los diversos términos de consecuencia. Aquello con alta probabilidad de alterar significativamente la función proteica, como stop_gained o la alteración de sitios de splicing, se clasifica como HIGH, missense_variant como MODERATE, synonymous_variant como LOW, y las variantes en lo profundo de un intrón suelen clasificarse como MODIFIER. Dado que una variante puede producir diferentes resultados en distintos transcritos (debido al splicing alternativo, etc.), VEP enumera todos los resultados por transcrito y presenta el más grave como el valor representativo.

Ejemplo de cálculo manual: Situación de múltiples transcritos

Si en un gen existen el transcrito A (la variante se ubica en el exón 3, missense_variant → MODERATE) y el transcrito B (la misma coordenada se ubica en un intrón, intron_variant → MODIFIER), VEP informará ambos resultados, pero adoptará missense_variant como el valor representativo por ser la "consecuencia más grave (most severe consequence)".

Resultado representativo=argmaxtranscript  ranking de IMPACT(consequence)\text{Resultado representativo} = \arg\max_{\text{transcript}} \; \text{ranking de IMPACT}(\text{consequence})

Confiar únicamente en este valor representativo puede llevar a sobreestimar las variantes graves solo para ciertos transcritos, o bien, ocultar transcritos clínicamente importantes dentro del valor representativo. En la práctica, es más seguro revisar junto con el valor representativo la lista completa de resultados por transcrito.

Práctica: Verificación de anotaciones de variantes mediante VEP REST API (Colab)

python
# Ejecutar en Colab. Consulta la anotación de una variante con la API REST de Ensembl VEP.
import requests
def vep_annotate(hgvs_notations, species="human"):
url = f"https://rest.ensembl.org/vep/{species}/hgvs"
r = requests.post(
url,
headers={"Content-Type": "application/json", "Accept": "application/json"},
json={"hgvs_notations": hgvs_notations},
timeout=30,
)
r.raise_for_status()
return r.json()
# Ejemplo de HGVS genómico GRCh38 de la documentación REST de Ensembl
result = vep_annotate(["9:g.22125503G>C"])
for entry in result:
for tc in entry.get("transcript_consequences", []):
print(
f"Transcrito: {tc.get('transcript_id')}, "
f"Consecuencia: {tc.get('consequence_terms')}, "
f"Impacto: {tc.get('impact')}"
)

Es importante en la práctica verificar directamente si se obtienen diferentes consequence_terms para varios transcritos y desarrollar el hábito de identificar cuál es el transcrito canónico (de referencia) más comúnmente citado.

Mapeo CS

  • Consulta del árbol de intervalos: El procedimiento para determinar en qué intervalo de exón o intrón cae la coordenada de una variante es un problema idéntico a la consulta de superposición (overlap) de la estructura de datos de árbol de intervalos.
  • Clasificador basado en reglas: El proceso de asignación de términos SO sigue la estructura de un clasificador basado en reglas, que coincide secuencialmente con reglas predefinidas según los patrones de cambio del codón.
  • Coincidencia por prioridad: El procedimiento para seleccionar el valor representativo entre varios resultados de transcritos sigue un patrón similar a la selección de una única opción mediante prioridad cuando múltiples reglas coinciden simultáneamente en un motor de reglas.

Defectos frecuentes

  • Observar solo la consecuencia más severa (most severe consequence) sin revisar los resultados de todos los transcritos: Los resultados de transcritos expresados únicamente en tejidos específicos pueden quedar enmascarados por el valor representativo. Para decisiones clínicamente importantes, se deben consultar conjuntamente los resultados por cada transcrito.
  • Igualar la puntuación IMPACT con la patogenicidad clínica: La puntuación HIGH indica que "es probable que cambie significativamente la secuencia de proteínas", pero no constituye en sí misma una determinación clínica de que cause enfermedad. Para la evaluación de patogenicidad se requiere la verificación cruzada con F14 (como AlphaMissense) o bases de datos clínicas (ClinVar).

Para profundizar más

El texto ha sido reescrito directamente por el equipo de investigación del BPD.

  • Documentación oficial de Ensembl VEP: Referencia completa de los términos de consecuencia y las reglas de clasificación IMPACT.
  • Sitio web oficial de Sequence Ontology: Definiciones de términos estándar como missense_variant.
  • Documentación de la API REST de VEP: Todos los puntos finales para llamadas programáticas.

En el siguiente capítulo D04, se abordará cómo se visualizan estas variantes y genes anotados en datos de expresión de tejidos tumorales y normales, así como su integración con bases de datos públicas.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...