Si las células están muertas, ¿cómo leer el tiempo?
Hasta la sección S31, hemos clasificado a las células como tipos estáticos: linfocitos T, linfocitos B, monocitos. Pero la vida no es una imagen fija. Las células madre hematopoyéticas se diferencian en eritrocitos y leucocitos a través de varias etapas. Las células tumorales cambian de estado al exponerse a fármacos. Este cambio es un flujo continuo.
El problema es que el scRNA-seq mata a la célula en el instante en que la lee. Lo que tenemos en nuestras manos es una instantánea de un solo momento, no una secuencia temporal que rastree la misma célula a lo largo del tiempo. Sin embargo, queremos reconstruir el eje temporal de la diferenciación. ¿Cómo es posible?
Idea central: la similitud es tiempo
La clave reside en una suposición: en un proceso continuo, las células con transcritomas similares se encuentran en puntos similares del proceso. Si tomamos una muestra de tejido hematopoyético en un instante dado, contendrá simultáneamente células madre, progenitores tempranos, etapas intermedias y células maduras. Si alineamos estas células en una línea basada en la similitud de sus transcritomas, ese orden corresponde a la dirección del progreso de la diferenciación.
A este orden no lo llamamos tiempo real, sino pseudotiempo. Es la "distancia en el espacio de transcritomas" desde el punto de inicio (célula madre) hasta cada célula. Reorganizar células de diferentes etapas de maduración contenidas en una sola instantánea, como si el tiempo hubiera transcurrido — esto es todo lo que implica la estimación de trayectorias.
PAGA: un mapa de las conexiones entre clústeres
Conectar directamente miles de células introduce mucho ruido. PAGA (Partition-based Graph Abstraction) primero abstrae los clústeres de Leiden de la sección S30 como nodos y luego mide la intensidad de la conexión entre clústeres.
Realiza una prueba estadística para determinar qué tan vecinos son las células de dos clústeres en un grafo kNN; si están conectados más fuertemente de lo esperado por azar, traza una arista entre los dos clústeres. El resultado es un grafo abstracto que muestra "qué tipo de célula conduce a qué otro tipo". En el contexto hematopoyético, se dibuja un mapa de bifurcación como: células madre → progenitores mieloideos → granulocitos, → progenitores eritroides → eritrocitos.
La ventaja de PAGA es que muestra tanto las conexiones como las desconexiones. En lugar de forzar a todas las células a encajar en una única trayectoria, conecta solo donde existe una conexión real. Esto permite representar con honestidad la diferenciación con múltiples bifurcaciones o linajes completamente separados.
Monocle3: el grafo principal que atraviesa las células
Monocle3 aborda el problema desde otra perspectiva. Aprende un grafo principal en un espacio de baja dimensión como UMAP: una curva en forma de árbol que sigue el centro de la nube de células, atravesando su distribución. Luego, al especificar la raíz (célula madre), la distancia geodésica desde la raíz a lo largo del grafo principal se convierte en el pseudotiempo de cada célula.
El resumen de las características de ambas herramientas es el siguiente:
| Elemento | PAGA | Monocle3 |
|---|---|---|
| Unidad | Clúster (grafo abstracto) | Célula individual (grafo principal) |
| Fortalezas | Diagnóstico de conexiones/desconexiones, mapa de bifurcaciones | Pseudotiempo a nivel celular, puntos de bifurcación |
| Salida | Mapa de conectividad de clústeres | Pseudotiempo por célula + trayectorias |
| Combinación estándar | Integración con Scanpy | R (monocle3) |
En la práctica, es común utilizar primero PAGA para trazar un mapa general (para ver qué está conectado) y luego combinarlo con pseudotiempo de difusión o Monocle3 para asignar el orden a nivel celular.
Estimación manual del pseudotiempo
Supongamos que 5 células están dispuestas aproximadamente en una cadena A–B–C–D–E en el espacio transcriptómico, y que A es la célula madre (raíz). Al construir un grafo basado en las distancias entre vecinos, se generan aristas A-B, B-C, C-D y D-E. Si calculamos la distancia más corta en el grafo desde A hasta cada célula, el pseudotiempo será {A:0, B:1, C:2, D:3, E:4}. E es la célula más madura. Aunque en la realidad hay decenas de miles de células y bifurcaciones que complican el panorama, el principio fundamental se resume en esta única línea: la distancia del grafo desde la raíz.
Práctica con Scanpy (diferenciación hematopoyética Paul15)
Ejecutamos PAGA + pseudotiempo de difusión utilizando los datos integrados de diferenciación hematopoyética de Scanpy.
import scanpy as scadata = sc.datasets.paul15() # Datos de diferenciación hematopoyética de médula ósea
# Preprocesamiento estándar (S28~S29 resumido)sc.pp.normalize_total(adata, target_sum=1e4); sc.pp.log1p(adata)sc.pp.pca(adata, n_comps=30)sc.pp.neighbors(adata, n_neighbors=15)sc.tl.leiden(adata, resolution=1.0, flavor="igraph", n_iterations=2)
# PAGA: Mapa de conectividad entre clústeressc.tl.paga(adata, groups="leiden")sc.pl.paga(adata, color="leiden") # Ver qué clústeres están conectados
# Inicialización UMAP con PAGA (incrustación que preserva la trayectoria)sc.tl.umap(adata, init_pos="paga")sc.pl.umap(adata, color="leiden")# Pseudotiempo de difusión: asignar tiempo tras especificar la célula raízadata.uns["iroot"] = 0 # Una célula del clúster conocido como células madresc.tl.diffmap(adata)sc.tl.dpt(adata)sc.pl.umap(adata, color="dpt_pseudotime") # Más lejos de la raíz = más madurocolor="dpt_pseudotime" En UMAP, si los colores se difuminan desde la raíz (0) en forma de degradado, esa dirección indica la dirección del proceso de diferenciación. Al representar gráficamente la expresión de genes específicos en relación con el eje de pseudotiempo (por ejemplo, sc.pl.paga_path), se puede observar la dinámica de los genes que se activan y desactivan a medida que avanza la diferenciación. En el caso de la hematopoyesis, esto se manifiesta como un cambio en el que los marcadores de las células madre se desactivan y los marcadores específicos de la línea celular se activan.
Correspondencia de conceptos
- Distancia mínima en el grafo / distancia geodésica: El pseudotiempo es la distancia en el grafo desde la raíz. Esto está directamente relacionado con la distancia mínima (Dijkstra) y la distancia geodésica de DryBench.
- Grafo principal / árbol de expansión mínima: El grafo principal de Monocle3 es un árbol que atraviesa la nube de datos, y es una extensión del árbol de expansión mínima (MST) y las curvas principales.
- Abstracción del grafo: La agrupación de clústeres en PAGA comprime el grafo a un nivel superior, lo que se asemeja a la idea de los algoritmos de grafos multinivel.
- Prueba estadística de vecindad: La conectividad de los clústeres implica probar la densidad de los vecinos en comparación con una expectativa aleatoria, lo que constituye una prueba de significación de la red.
Problemas comunes
- Especificación incorrecta de la raíz: El pseudotiempo depende totalmente del punto de inicio. Se debe seleccionar como raíz células madre o progenitoras con una base biológica sólida.
- Imposición de trayectorias en datos que no representan un proceso continuo: Dibujar trayectorias forzadas entre tipos de células no relacionados (por ejemplo, linfocitos T maduros frente a linfocitos B) no tiene sentido. Primero se debe verificar la conectividad mediante PAGA.
- Trayectorias en datos sin corrección de lotes: El efecto de lote crea trayectorias falsas. Primero se debe realizar la integración S31.
- Interpretación del pseudotiempo como tiempo real: El pseudotiempo representa solo el orden, no el tiempo transcurrido real (horas/días). La información sobre la velocidad se aborda en la siguiente sección sobre la velocidad del ARN.
Para profundizar
El texto principal es una descripción reconstruida directamente por BPD. Para un estudio más profundo, utilice los siguientes materiales de referencia:
- Libro web gratuito: Single-cell best practices (sc-best-practices.org) — El capítulo sobre la estimación de trayectorias aborda en detalle la selección y el diagnóstico de métodos.
- Artículo original (PAGA): Wolf et al. (2019), PAGA: graph abstraction reconciles clustering with trajectory inference through a topology preserving map of single cells, Genome Biology 20:59.
- Artículo original (Monocle3): Cao et al. (2019), The single-cell transcriptional landscape of mammalian organogenesis, Nature 566:496. Es la fuente de las trayectorias principales a gran escala.
- Estudio comparativo: Saelens et al. (2019), A comparison of single-cell trajectory inference methods, Nature Biotechnology 37:547. Es la guía que compara objetivamente 45 métodos.
El pseudotiempo proporcionó el orden de las células, pero no la dirección ni la velocidad: no sabemos si una célula avanza o retrocede. En el próximo episodio S33, exploraremos la velocidad del ARN (RNA velocity), que predice el futuro celular mediante la proporción de maduración/inmadurez del ARNm, y añadiremos flechas reales a la imagen.