Volver a la lista

Kraken2 y MetaPhlAn: Identificar y cuantificar la presencia de diferentes especies microbianas en una muestra que contiene cientos de especies mezcladas.

Dos enfoques para analizar la composición microbiana de muestras intestinales y ambientales: comparemos las diferencias entre la clasificación del ancestro común mínimo (MRCA) basada en k-meros de Kraken2 y la cuantificación de marcadores de clado de MetaPhlAn, ejecutándolos directamente en Galaxy.

Intermedio
|
18min
|
Verificado (2026-07-24)
metagenomicsKraken2MetaPhlAnmicrobiome
Progreso0/120 (0%)

Cuando una sola muestra contiene cientos de especies

Hasta la sección S23, hemos trabajado con cepas únicas cultivadas en pureza. Sin embargo, muchas muestras del mundo real no son así. Una cucharada de heces intestinales contiene cientos o miles de especies bacterianas, y en el suelo, el agua de mar y las aguas residuales, la mayoría de los microorganismos ni siquiera pueden cultivarse. Al no poder cultivarse, también es difícil ensamblarlos. Por lo tanto, cambiamos la pregunta: en lugar de "completar este genoma", la pregunta es "¿quién está aquí y en qué cantidad?".

Este es el punto de partida de la metagenómica. En esta sección, distinguimos dos enfoques representativos: Kraken2, que clasifica las lecturas una por una, y MetaPhlAn, que mide la composición mediante marcadores específicos de especie, y aprendemos cuándo utilizar cada uno.

Kraken2: etiquetar cada lectura con un nombre

La idea detrás de Kraken2 es simple y rápida. Divide las lecturas en k-mers y consulta en una base de datos de referencia a qué taxón pertenece cada k-mer. El problema es que un mismo k-mer puede aparecer comúnmente en varias especies. Este es el caso de las secuencias conservadas compartidas entre Escherichia coli y Shigella.

Aquí aparece el ancestro común más reciente (LCA). Si un k-mer aparece tanto en la especie A como en la B, ese k-mer se asigna no a A ni a B, sino al ancestro común de A y B (género o familia). Al combinar los taxones de los múltiples k-mers que contiene una lectura en el árbol taxonómico, se determina el nodo más bajo al que la lectura puede llegar con confianza como su etiqueta final.

  • Si hay muchos k-mers específicos a nivel de especie → la lectura se clasifica a nivel de especie.
  • Si solo hay secuencias compartidas → permanece en niveles superiores como género o familia, evitando clasificaciones erróneas.

Kraken2 implementa esta consulta mediante minimizadores y hash comprimidos, procesando millones de lecturas por segundo. Aquí se aplican directamente el índice FM y la indexación por hash aprendidos en M15, así como los minimizadores de M16.

La clasificación sola no es suficiente: Bracken

Kraken2 cuenta el número de lecturas, pero esto no equivale directamente a la abundancia relativa de las especies. Las especies con genomas más grandes generan más lecturas, y las lecturas que permanecen en nodos superiores se excluyen del conteo a nivel de especie. Bracken aplica una reestimación bayesiana a los resultados de Kraken2 para redistribuir las lecturas asignadas a niveles superiores a nivel de especie y calcular la abundancia relativa corregida por el tamaño del genoma. En la práctica, Kraken2 y Bracken se utilizan casi siempre en pareja.

MetaPhlAn: observar solo los marcadores específicos de especie

MetaPhlAn adopta una filosofía diferente. En lugar de clasificar todas las lecturas, alinea las lecturas únicamente con una base de datos de millones de genes marcador específicos de clado (secuencias que existen solo en ese clado y no en otros). Estima directamente la abundancia relativa de cada especie a partir de la proporción de lecturas alineadas con los marcadores.

La diferencia entre ambos enfoques se resume en la siguiente tabla:

ElementoKraken2 (+Bracken)MetaPhlAn
ObjetivoClasificación de todas las lecturasAlineación solo de genes marcadores
SalidaRecuento de lecturas → abundancia reestimadaAbundancia relativa (%) directa
VentajasRápido, detección de lecturas nuevas/desconocidas, incluye virusBaja tasa de falsos positivos, precisión a nivel de especie/cepa
Tamaño de la base de datosGrande (decenas de GB)Relativamente pequeño
DesventajasFalsos positivos si la base de datos está contaminadaNo detecta especies nuevas sin marcadores

Regla empírica: "Quiero obtener una visión general de lo que hay" → Kraken2, "Quiero cuantificar con precisión la composición de especies conocidas" → MetaPhlAn. Ejecutar ambos y realizar una validación cruzada es la opción más robusta.

Entender el LCA manualmente

Supongamos que el árbol de clasificación es (familia) Enterobacteriaceae → (género) Escherichia, Shigella. Si los 3 k-meros de una lectura apuntan a {Escherichia}, {Escherichia, Shigella} y {Escherichia} respectivamente, la intersección es fiable y la lectura se asigna a Escherichia (género). Por el contrario, si los k-meros se dirigen a {Escherichia} y {Shigella}, el nodo común mínimo seguro sube un nivel hasta Enterobacteriaceae (familia). La clave del LCA es subir de nivel cuando hay duda para evitar clasificaciones erróneas.

Analizar la composición del microbioma en Galaxy

Realizaremos una práctica con lecturas de metagenómica shotgun en usegalaxy.eu.

Flujo de trabajo

  1. Cargar / FastQC / fastp — Verificar y recortar la calidad de las lecturas.
  2. (Opcional) Eliminar secuencias del huésped — Eliminar las lecturas que se alinean con el genoma humano en muestras humanas (para evitar clasificaciones erróneas).
  3. Kraken2 — Seleccionar la base de datos estándar, especificar el modo paired-end. Salida: clasificación por lectura + informe.
  4. Bracken — Reestimar la abundancia a nivel de especie a partir del informe de Kraken2.
  5. Krona — Visualizar los resultados de forma interactiva en un gráfico circular jerárquico.

Referencia de la línea de comandos

bash
# Clasificación con Kraken2
kraken2 --db k2_standard \
--paired reads_R1.fastq.gz reads_R2.fastq.gz \
--report sample.kreport --output sample.kraken --threads 8
# Reestimación de abundancia a nivel de especie con Bracken
bracken -d k2_standard -i sample.kreport -o sample.bracken -r 150 -l S
# MetaPhlAn (basado en marcadores)
metaphlan reads_R1.fastq.gz,reads_R2.fastq.gz \
--input_type fastq --bowtie2out bt2.bz2 -o profile.txt --nproc 8

En el gráfico de Krona, el círculo interior representa las clasificaciones superiores (filo y clase), y a medida que nos alejamos hacia el exterior, llegamos al nivel de especie. Al hacer clic para explorar más a fondo, podemos obtener de inmediato información sobre la composición, como: "esta muestra está dominada por Firmicutes y tiene una proporción baja de Bacteroidetes".

Correspondencia de conceptos

  • Ancestro común más reciente (LCA): La consulta de LCA en el árbol taxonómico sigue la misma estructura de datos del árbol y el algoritmo LCA que se utiliza en DryBench. Los fundamentos son el cálculo de LCA fuera de línea (Tarjan) y la elevación binaria.
  • Búsqueda de hash/tri: El mapeo de k-mers a taxones implica búsquedas masivas en tablas hash; el hash comprimido de Kraken2 es un ejemplo práctico de la compensación entre espacio y tiempo.
  • Muestreo de minimizadores: Indexar solo los minimizadores representativos en lugar de todos los k-mers reduce el uso de memoria, lo cual está directamente relacionado con M16.
  • Reestimación bayesiana (Bracken): Inferir la abundancia latente a partir de los recuentos observados es una aplicación de la estimación EM/bayesiana.

Problemas comunes

  • Ausencia de eliminación de secuencias del huésped: Las lecturas humanas se clasifican erróneamente como bacterias, lo que contamina la composición. La eliminación del huésped es esencial en las muestras clínicas.
  • Uso directo de los recuentos de Kraken2 como medida de abundancia: Existen sesgos relacionados con el tamaño del genoma y la asignación a niveles superiores. Debemos aplicar la reestimación con Bracken.
  • Uso de bases de datos pequeñas u obsoletas: Las especies que no están presentes en la base de datos pueden pasar desapercibidas o agruparse en niveles superiores. Utilicemos la base de datos estándar más reciente (preferiblemente, que incluya virus y arqueas).
  • Confusión entre amplicones 16S y secuenciación de escopeta (shotgun): Los datos de 16S corresponden a la serie QIIME2 (S25), mientras que Kraken2/MetaPhlAn están diseñados para lecturas completas de secuenciación de escopeta. Confirmemos primero el tipo de experimento.

Para profundizar más

El texto es una descripción reconstruida directamente por BPD. Para un estudio más avanzado, utilicemos los siguientes materiales de referencia:

  • Galaxy Training Network: Tutorial Metagenomics: Taxonomic profiling (training.galaxyproject.org, documentación completa). Es el estándar para la práctica con Kraken2 y Krona.
  • Artículo original (Kraken2): Wood, Lu, Langmead (2019), Improved metagenomic analysis with Kraken 2, Genome Biology 20:257.
  • Artículo original (Bracken): Lu et al. (2017), Bracken: estimating species abundance in metagenomics data, PeerJ Computer Science 3:e104.
  • Artículo original (MetaPhlAn 4): Blanco-Míguez et al. (2023), Extending and improving metagenomic taxonomic profiling with uncharacterized species using MetaPhlAn 4, Nature Biotechnology 41:1633.
  • Visualización: Ondov, Bergman, Phillippy (2011), Interactive metagenomic visualization in a Web browser, BMC Bioinformatics 12:385 (Krona).

Después de analizar la composición obtenida mediante secuenciación shotgun, en el siguiente capítulo, S25, abordaremos QIIME2, una herramienta estándar para los flujos de trabajo de microbiomas basados en amplicones de 16S, y que destaca por registrar de manera reproducible todo el proceso analítico, garantizando la trazabilidad. Con esto, completamos el nivel S1.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...