Volver a la lista

QIIME2: Análisis del microbioma 16S y cómo hacer que los datos recuerden «lo que hice»

Analicemos en la práctica el estándar QIIME2 para el análisis del microbioma de amplicones 16S. Observaremos el denoising con DADA2, los ASV, la diversidad alfa/beta y el concepto de procedencia (provenance), que permite que los propios datos recuerden su historial de análisis.

Intermedio
|
20min
|
Verificado (2026-07-24)
QIIME216S ampliconmicrobiome diversityprovenance
Progreso0/120 (0%)

¿Puede responder a "¿Con qué parámetros exactos se generó esa gráfica?"

Hace seis meses, tracé una gráfica de diversidad para un artículo sobre microbioma. El revisor preguntó: "¿Cuál fue el umbral de denoising utilizado? ¿Qué versión de la base de datos de referencia empleó?". Reviso mis notas, pero los recuerdos son borrosos. Si no se puede reproducir, el artículo pierde solidez. Este dolor de la reproducibilidad es una enfermedad crónica en todo el campo de la bioinformática.

QIIME2 es una herramienta que ha incorporado este problema directamente en su diseño. Es el estándar de facto para el análisis de microbiomas basados en amplicones de ARN 16S y todos los archivos de datos recuerdan por sí mismos cómo fueron creados. En esta sección, exploramos el flujo de trabajo del ARN 16S y por qué el concepto de proveniencia es un cambio radical. Es la última entrega de la Serie S1.

Amplicón 16S — ¿Por qué solo se lee un gen?

La Serie S24 secuenció shotgun (metagenómica) cubriendo todo el genoma. El enfoque del ARN 16S es diferente: amplifica y secuencia solo un fragmento del gen de ARN 16S, presente en casi todas las bacterias. Este gen presenta regiones conservadas (donde se unen los cebadores) y regiones variables (V1~V9, que difieren entre especies), alternándose entre sí; por lo tanto, la secuencia de las regiones variables permite distinguir las especies. Es económico y tiene menos contaminación del huésped, lo que lo hace adecuado para cohortes grandes. Sin embargo, su resolución a nivel de especie y la información funcional son inferiores a las del enfoque shotgun.

DADA2 — De OTU a ASV

El método antiguo agrupaba secuencias similares con una similitud del 97% para crear OTU (Unidad Taxonómica Operacional). El problema es que este umbral del 97% es arbitrario y no distingue entre errores de secuenciación y variaciones biológicas reales.

DADA2 cambia el enfoque: aprende un modelo de errores de secuenciación a partir de los datos y luego determina estadísticamente si una secuencia observada es "una secuencia biológica real + error", eliminando así los errores. El resultado son variantes de secuencia precisas, distinguibles a nivel de nucleótido individual — ASV (Variante de Secuencia de Amplicón). Al no depender de umbrales, los ASV permiten la comparación entre estudios y hoy en día han reemplado a las OTU como el estándar.

Diversidad — Dos preguntas

Existen dos ejes para resumir el microbioma.

Diversidad Alpha — "¿Qué tan diversa es una muestra individual?" El indicador representativo, la entropía de Shannon, es idéntico a la entropía de información de CS.

H=i=1SpilnpiH = -\sum_{i=1}^{S} p_i \ln p_i

Donde pip_i es la proporción relativa de la especie ii, y SS es el número de especies. Cuanto más uniforme sea la abundancia de las especies, mayor será HH.

Cálculo manual de Shannon

Si hay tres especies con proporciones [0.5, 0.3, 0.2], entonces:

H=(0.5ln0.5+0.3ln0.3+0.2ln0.2)=(0.3470.3610.322)=1.030H = -(0.5\ln 0.5 + 0.3\ln 0.3 + 0.2\ln 0.2) = -(-0.347 - 0.361 - 0.322) = 1.030

Cuando una sola especie concentra las proporciones [0.9, 0.05, 0.05], el valor de H0.394H \approx 0.394 cae abruptamente. Esto coincide exactamente con la intuición de que a mayor concentración (dominancia), menor es la diversidad.

Diversidad Beta — "¿Qué tan diferentes son dos muestras entre sí?" Aquí es donde brilla el indicador UniFrac, característico del microbioma. En lugar de comparar simplemente las listas de especies, mide la distancia como la proporción de longitudes de ramas que no se comparten entre las dos muestras sobre un árbol filogenético. Refleja con menor peso las diferencias entre especies estrechamente emparentadas y con mayor peso las diferencias entre especies distantes. Es una medida de distancia que incorpora el contexto evolutivo.

Proveniencia — Los datos recuerdan su historia

Esta es la verdadera innovación de QIIME2. Todos los resultados de QIIME2 son artefactos .qza(datos) y .qzv(visualización). Aunque parecen un solo archivo, internamente contienen el registro completo de todas las etapas utilizadas para generar estos datos — el plugin utilizado, los parámetros, la versión, el UUID del artefacto de entrada — incrustados en un DAG (grafo acíclico dirigido).

Es decir, si arrastras un único archivo de resultado a view.qiime2.org, se despliega gráficamente toda la genealogía: "lecturas raw → demux → DADA2 (con estos parámetros) → taxonomía (con esta versión de BD) → esta figura". Podrás responder a las preguntas de los revisores seis meses después con un solo archivo. Esto es exactamente lo mismo que dos conceptos de la informática: el grafo de commits de Git (un historial inmutable donde cada estado referencia a su padre) y la indexación por contenido (objetos inmutables identificados por su contenido).

Práctica — Recorrido completo del flujo de trabajo 16S

QIIME2 se instala mediante un entorno conda (ver el siguiente capítulo sobre Pixi/uv). Aquí solo observamos el flujo central.

bash
# 1) Importar lecturas → como artefacto (.qza) (desde este momento comienza el registro de provenance)
qiime tools import --type 'SampleData[PairedEndSequencesWithQuality]' \
--input-path manifest.tsv --input-format PairedEndFastqManifestPhred33V2 \
--output-path demux.qza
# 2) Denoising con DADA2 → tabla de ASV + secuencias representativas
qiime dada2 denoise-paired --i-demultiplexed-seqs demux.qza \
--p-trim-left-f 13 --p-trunc-len-f 150 \
--p-trim-left-r 13 --p-trunc-len-r 150 \
--o-table table.qza --o-representative-sequences rep-seqs.qza \
--o-denoising-stats stats.qza
# 3) Árbol filogenético (para UniFrac)
qiime phylogeny align-to-tree-mafft-fasttree \
--i-sequences rep-seqs.qza \
--o-rooted-tree rooted-tree.qza --o-alignment aln.qza \
--o-masked-alignment masked.qza --o-tree unrooted.qza
# 4) Diversidad (alpha/beta a la vez)
qiime diversity core-metrics-phylogenetic \
--i-phylogeny rooted-tree.qza --i-table table.qza \
--p-sampling-depth 1000 --m-metadata-file metadata.tsv \
--output-dir diversity/

Al arrastrar los .qzv generados a view.qiime2.org, se abrirá una pestaña de proveniencia junto con la visualización gráfica. Parámetros como los de --p-trunc-len quedan registrados permanentemente en ella. Ya no tendrás que esforzarte preguntándote "¿qué valor usé?".

Mapeo conceptual

  • Provenance DAG = Grafo de commits de Git: Un grafo dirigido inmutable donde cada artefacto referencia a sus artefactos padres y a las operaciones realizadas. Es la estructura de datos fundamental del control de versiones.
  • Direccionamiento por contenido: Identificar un artefacto mediante un UUID es una idea similar al SHA de Git o al CID de IPFS.
  • Entropía de la información (Shannon): La diversidad alfa es en sí misma la entropía de Shannon, lo que la conecta directamente con la teoría de la compresión y la información.
  • Distancia filogenética (UniFrac): Una distancia basada en la longitud de las ramas del árbol, que aplica la estructura de datos de árbol y la medición de distancias de DryBench a la biología.

Defectos frecuentes

  • Establecer trunc-len arbitrariamente sin ver el gráfico de calidad: Debes observar la distribución de calidad de qiime demux summarize para decidir dónde cortar. Si lo dejas demasiado largo, habrá errores; si lo dejas demasiado corto, se perderá información.
  • Usar cualquier valor para sampling depth (rarefacción): Ignorar las diferencias en el número de lecturas entre muestras distorsiona la comparación de diversidad. Se debe determinar observando la profundidad mínima de la muestra.
  • Insistir en el método OTU: A menos que haya una razón especial, ASV (DADA2) es el estándar. Es ventajoso para la reproducibilidad y la comparación entre estudios.
  • Ignorar la proveniencia y compartir solo archivos intermedios: Si envías solo CSVs en lugar de artefactos, se pierde el historial. Compartamos y conservemos el propio .qza/.qzv.

Para profundizar más

El texto principal es una descripción reconstruida directamente por BPD. Para profundizar, utilicemos los siguientes materiales canónicos.

  • Documentación y tutoriales oficiales de QIIME2: Tutorial "Moving Pictures" (docs.qiime2.org, documentación completa). Es el estándar para seguir paso a paso todo el proceso de 16S.
  • Artículo original (QIIME2): Bolyen et al. (2019), Reproducible, interactive, scalable and extensible microbiome data science using QIIME 2, Nature Biotechnology 37:852. Contiene la filosofía de diseño de la proveniencia.
  • Artículo original (DADA2): Callahan et al. (2016), DADA2: High-resolution sample inference from Illumina amplicon data, Nature Methods 13:581. Es la fuente original de los ASV.
  • UniFrac: Lozupone & Knight (2005), UniFrac: a new phylogenetic method for comparing microbial communities, Applied and Environmental Microbiology 71:8228.

Con esto, se completa la serie S1 (S01~S25): hemos recorrido todo el flujo de trabajo de NGS, desde la calidad de FASTQ hasta la detección de variantes, cuantificación, ensamblaje y metagenómica. A partir del siguiente capítulo, S27, el escenario cambiará nuevamente. Entraremos en el mundo de las células individuales, que lucha contra el fantasma del promedio tisular, comenzando con la gestión de calidad (QC) de células como nuestra primera aplicación práctica.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...