El problema de que las células T de dos pacientes se agrupen en conjuntos distintos
Hasta la sección S30, solo se analizaba un único conjunto de datos. Sin embargo, en la investigación real, se combinan los datos de 10 pacientes y 20 muestras tomadas en días diferentes. Aquí es donde falla el enfoque. Al generar un diagrama UMAP, las células se agrupan no por tipo celular, sino por paciente y lote experimental. Las células T del paciente A y las del paciente B, aunque sean células T, terminan ubicadas en conjuntos separados.
La causa es el efecto de lote. Las diferencias técnicas, como el lote de reactivos, el momento del procesamiento, el secuenciador y las condiciones de disociación celular, dejan un sesgo sistemático en la expresión génica. Si no se elimina este efecto, se obtendrán conclusiones falsas, como "¡se ha descubierto un tipo celular específico del paciente A!". El objetivo de esta sección, que es el final de la sección §S2.1 sobre células individuales, es eliminar los lotes y, al mismo tiempo, preservar las diferencias biológicas reales.
La esencia del problema: adaptación de dominio
La corrección de lotes es un problema similar a la adaptación de dominio en el aprendizaje automático. Consiste en alinear datos de múltiples dominios (lotes) en una representación común, eliminando las etiquetas de dominio pero conservando el contenido (los tipos celulares). Dos enfoques principales difieren en su filosofía.
Harmony: agrupación suave iterativa + corrección lineal
Harmony es un método ligero y rápido que funciona en el espacio de PCA. Inicia un bucle iterativo.
- Agrupación suave: Asigna las células a clústeres de forma suave (una célula se asigna probabilísticamente a varios clústeres). Sin embargo, aplica una penalización para asegurar que cada clúster contenga células de múltiples lotes de forma equilibrada.
- Corrección por lote: Calcula la diferencia entre los centros de los lotes dentro de cada clúster y desplaza las coordenadas PCA de las células en la medida del efecto del lote.
- Se repiten los pasos 1 y 2 hasta la convergencia.
La idea clave es que "si un tipo celular es el mismo, debe aparecer en todos los lotes". Si un clúster está compuesto únicamente por células de un solo lote, se aplica una penalización, lo que obliga al algoritmo a atraer esas células hacia tipos celulares similares en otros lotes. Al ser un desplazamiento lineal, es rápido y solo corrige las coordenadas sin modificar la expresión original.
scVI: espacio latente libre de lotes mediante modelos generativos profundos
scVI adopta un enfoque completamente diferente y más complejo. Utiliza un autoencoder variacional (VAE) para codificar las células en un vector latente de baja dimensión , modelando los conteos con una distribución binomial negativa e incluyendo el lote como covariable explícita.
Aquí, es la etiqueta de lote de la célula . Cuando el decodificador aprende a reconstruir los conteos observados a partir del "latente + lote ", el latente transfiere la varianza explicada por el lote al decodificador y conserva solo la señal biológica. El aprendido es, por tanto, una representación libre de lotes.
scVI es potente. Al ser no lineal, captura efectos de lote complejos y modela los conteos de forma probabilística, manejando incluso la incertidumbre. Sin embargo, requiere GPU y tiempo de entrenamiento, y es sensible a los hiperparámetros.
Las características de ambos enfoques se resumen a continuación:
| Ítem | Harmony | scVI |
|---|---|---|
| Método | Corrección lineal en el espacio PCA | Modelo generativo profundo (VAE) |
| Velocidad | Muy rápida | Lenta (GPU) |
| Salida | Incrustaciones corregidas | Representaciones latentes + expresión normalizada |
| Casos fuertes | Integración rápida, tamaño medio | Lotes complejos, atlas a gran escala |
Riesgo crítico: sobrecorrección
El error más temido en la corrección de lotes es la sobrecorrección. Al eliminar los lotes de forma demasiado agresiva, se pueden eliminar las diferencias biológicas reales. Por ejemplo, si el lote está relacionado con el grupo de enfermedad (lote A = control, lote B = cáncer), eliminar el lote equivale a eliminar la señal de la enfermedad.
Por lo tanto, después de la corrección, es esencial observar dos aspectos simultáneamente: si los lotes se han mezclado bien (por ejemplo, indicador iLISI, colores de lote distribuidos uniformemente en UMAP) y si los tipos celulares se han conservado adecuadamente (los marcadores siguen siendo específicos del tipo). Los indicadores de integración (benchmark scIB) evalúan el método mediante el equilibrio entre estos dos factores. No basta con decir que "los lotes están perfectamente mezclados".
Práctica en Scanpy (múltiples lotes)
Supongamos que la etiqueta de lote está en adata.obs["batch"].
import scanpy as sc# adata = normalización + HVG + PCA completado, obs['batch'] existe
# --- Método 1: Harmony (rápido) ---sc.external.pp.harmony_integrate(adata, key="batch") # Genera X_pca_harmonysc.pp.neighbors(adata, use_rep="X_pca_harmony")sc.tl.umap(adata)sc.pl.umap(adata, color=["batch", "cell_type"]) # Verifica simultáneamente la mezcla de lotes y la conservación del tipo# --- Método 2: scVI (potente, GPU) ---import scviscvi.model.SCVI.setup_anndata(adata, layer="counts", batch_key="batch")model = scvi.model.SCVI(adata, n_latent=30)model.train(max_epochs=200)adata.obsm["X_scVI"] = model.get_latent_representation()
sc.pp.neighbors(adata, use_rep="X_scVI")sc.tl.umap(adata)sc.pl.umap(adata, color=["batch", "cell_type"])En ambos resultados, es necesario observar lado a lado color="batch" y color="cell_type". El éxito se logra cuando los colores del lote se mezclan uniformemente y los tipos celulares mantienen agrupaciones bien definidas. Si los lotes se mezclan, pero los tipos celulares se desdibujan, se trata de una sobrecorrección.
Tengamos en cuenta que scVI toma como entrada layer="counts"(recuentos brutos). Aquí es donde layers["counts"], que se respaldó en S28, resulta útil.
Mapeo de dominios
- Adaptación de dominio: Alinear datos de múltiples dominios sin etiquetas es el problema central del aprendizaje por transferencia y la adaptación de dominio.
- VAE (Autoencoder Variacional): scVI aprende representaciones latentes como modelo generativo, lo que se relaciona directamente con la sección de aprendizaje profundo de DevBench; separar los lotes como covariables es una aplicación de representación disentangled.
- Agrupamiento suave iterativo (soft k-means): La asignación suave de Harmony sigue la estructura del EM/agrupamiento suave.
- Compensación entre normalización y conservación de la información: El riesgo de sobrecorrección es la versión biológica de la compensación entre sesgo y varianza, y entre compresión y fidelidad.
Defectos frecuentes
- Ignorar la sobrecorrección: Si solo se observa la mezcla de lotes sin verificar la conservación de los tipos celulares, se borran las señales reales. Siempre observemos ambos indicadores juntos.
- Confusión completa entre lote y condición: Si el lote es igual al grupo de enfermedad, ningún método puede separarlos. Es necesario distribuir uniformemente los lotes con respecto a la condición desde la etapa de diseño experimental (problema de diseño).
- Introducir valores normalizados log en scVI: scVI espera recuentos brutos. Introducir valores normalizados rompe el modelo binomial negativo.
- Expresión diferencial con incrustaciones corregidas: Las coordenadas corregidas son para el agrupamiento y la visualización. La expresión diferencial debe realizarse con la expresión previa a la corrección (o la API de expresión normalizada de scVI) introduciendo los lotes como covariables.
Para profundizar más
El texto es una narración reconstruida directamente por BPD. Para profundizar, utilicemos los siguientes materiales de referencia.
- Libro web gratuito de referencia: Single-cell best practices (sc-best-practices.org) — El capítulo de integración de datos aborda en detalle la comparación de métodos y el diagnóstico de la sobrecorrección.
- Artículo original (Harmony): Korsunsky et al. (2019), Fast, sensitive and accurate integration of single-cell data with Harmony, Nature Methods 16:1289.
- Artículo original (scVI): Lopez et al. (2018), Deep generative modeling for single-cell transcriptomics, Nature Methods 15:1053.
- Benchmark: Luecken et al. (2022), Benchmarking atlas-level data integration in single-cell genomics, Nature Methods 19:41 (scIB). Es un marco de evaluación objetiva para los métodos de integración.
Con esto, se completa la sección §S2.1 sobre análisis de células individuales (Introducción S26 → Control de calidad → Normalización → Reducción de dimensionalidad → Agrupamiento → Corrección de lotes). Ahora se cuenta con la capacidad de integrar múltiples conjuntos de datos, superando los límites de un solo experimento. A partir del siguiente capítulo, S32, se explorará una nueva dimensión: la estimación de la trayectoria que siguen las células al cambiar de estado a lo largo del tiempo, más allá de los mapas estáticos de tipos celulares, utilizando Monocle3, PAGA y el concepto de pseudotiempo.