Volver a la lista

UCE: Colocar las células en un sistema de coordenadas común sin importar el tipo de célula

Aborda los principios de UCE, que sustituye la identidad génica por incrustaciones proteicas para crear un sistema de coordenadas celulares único sin alineación interespecífica, y la práctica de transferencia de tipos celulares zero-shot.

Avanzado
|
20min
|
Verificado (2026-07-29)
UCEcross-species embeddingzero-shot transfercell atlas
Progreso0/120 (0%)

El límite dejado por F21 y F22: incrustaciones atrapadas en una sola especie

Tanto scGPT de F21 como Geneformer de F22 aprenden fijando la lista de genes de una especie específica (principalmente humana) como vocabulario. Sin embargo, en la práctica, es común querer comparar datos humanos con datos de modelos de ratón en el mismo espacio de coordenadas. Dado que los nombres y la cantidad de genes varían entre especies, ¿cómo se pueden colocar las células de diferentes especies en un único espacio de incrustación? UCE (Universal Cell Embedding, Stanford·CZ Biohub) aborda este problema utilizando como intermediario las proteínas producidas por los genes, en lugar de los nombres de los genes.

Principio — Expresar la identidad del gen mediante incrustaciones de proteínas y contexto cromosómico

Por qué los nombres de los genes no pueden cruzar especies

F21 y F22 trataron a los genes como entradas de vocabulario (vocabulary entry). Los genes humanos "TP53" y de ratón "Trp53" son genes ortólogos que realizan la misma función, pero sus cadenas de caracteres de nombre son diferentes y requieren tablas de mapeo de vocabulario separadas por especie. A medida que aumenta el número de especies, este mapeo se vuelve exponencialmente más complejo.

Vocabulario basado en nombres de genes    se requiere un mapeo separado por cada especie\text{Vocabulario basado en nombres de genes} \implies \text{se requiere un mapeo separado por cada especie}

Utilizar las incrustaciones de secuencias de proteínas como puente

UCE representa los genes no mediante cadenas de caracteres de nombre, sino mediante incrustaciones de la secuencia de la proteína que produce el gen. La implementación pública utiliza las incrustaciones del modelo de lenguaje de proteínas ESM-2 como punto de partida para los tokens de genes y agrupa los genes por cromosoma, ordenándolos según su posición en el genoma.

Identidad del gen g=ESM(secuencia de proteıˊnag)Rd\text{Identidad del gen } g = \text{ESM}(\text{secuencia de proteína}_g) \in \mathbb{R}^{d}

De esta manera, aunque TP53 humano y Trp53 de ratón tengan nombres diferentes, debido a la similitud evolutiva de sus secuencias de proteínas, se colocan en posiciones cercanas dentro del espacio de incrustación de ESM. Sin necesidad de tablas de mapeo de nombres de genes, los "genes funcionalmente correspondientes" se acercan automáticamente.

d(ESM(TP53), ESM(Trp53))d(ESM(TP53), ESM(cualquier gen))d(\text{ESM}(\text{TP53}),\ \text{ESM}(\text{Trp53})) \ll d(\text{ESM}(\text{TP53}),\ \text{ESM}(\text{cualquier gen}))

Combinar incrustaciones de células

En una célula, se extraen con reposición los genes expresados en proporción a su cantidad de expresión, y estos tokens de genes se introducen en un Transformer junto con el contexto cromosómico y la posición del genoma. La representación final del token CLS se convierte en el vector celular. La estructura aproximada es la siguiente:

vcell=Transformer({(ESM(proteıˊnag), xg):ggenes expresados})\vec{v}_{\text{cell}} = \text{Transformer}\big(\{(\text{ESM}(\text{proteína}_g),\ x_g) : g \in \text{genes expresados}\}\big)

La clave es que este proceso de combinación no depende de una tabla de correspondencia explícita de nombres de genes. Ya sean células humanas, de ratón o incluso de Drosophila, se pueden obtener los embeddings utilizando el mismo pipeline, y el modelo aprende para que el resultado se sitúe sobre un único sistema de coordenadas compartido. Esto no significa que restaure automáticamente todas las relaciones de ortología de forma perfecta.

Ejemplo de cálculo manual: Comparación de distancias de embeddings de genes ortólogos

Obtengamos una idea con un ejemplo hipotético de baja dimensión (2D). Si el embedding de TP53 humano es (0.8,0.6)(0.8, 0.6), el embedding de Trp53 de ratón es (0.75,0.65)(0.75, 0.65) y el embedding de un gen no relacionado es (0.5,0.2)(-0.5, 0.2), la distancia euclidiana es

d(TP53, Trp53)=(0.80.75)2+(0.60.65)2=0.0050.071d(\text{TP53, Trp53}) = \sqrt{(0.8-0.75)^2 + (0.6-0.65)^2} = \sqrt{0.005} \approx 0.071 d(TP53, gen no relacionado)=(0.8(0.5))2+(0.60.2)2=1.851.36d(\text{TP53, gen no relacionado}) = \sqrt{(0.8-(-0.5))^2 + (0.6-0.2)^2} = \sqrt{1.85} \approx 1.36

La distancia entre los genes ortólogos es abrumadoramente más corta que la distancia con el gen no relacionado. Esta propiedad es el mecanismo clave que permite la transferencia zero-shot entre especies en UCE.

Práctica: Emparejamiento zero-shot de tipos celulares en dos conjuntos de datos de diferentes especies (Código conceptual)

python
# Colab T4, nivel gratuito. Para extraer embeddings preentrenados reales de UCE, hay que seguir
# la canalización del repositorio oficial (incluido el precálculo de embeddings de proteínas).
import numpy as np
def cosine_similarity(a: np.ndarray, b: np.ndarray) -> float:
return float(np.dot(a, b) / (np.linalg.norm(a) * np.linalg.norm(b)))
# Se supone que human_cell_emb y mouse_cell_emb son embeddings celulares obtenidos con UCE.
def zero_shot_label_transfer(query_emb, reference_embs: dict[str, np.ndarray]) -> str:
"""
Compara el embedding de una célula query sin etiqueta con embeddings etiquetados
de tipos celulares de referencia y asigna zero-shot el tipo más parecido.
"""
best_label, best_score = None, -1.0
for label, ref_emb in reference_embs.items():
score = cosine_similarity(query_emb, ref_emb)
if score > best_score:
best_label, best_score = label, score
return best_label
# Ejemplo: aprender las etiquetas con un atlas humano de referencia de PBMC
# y asignar zero-shot tipos celulares a datos de bazo de ratón sin reentrenamiento adicional

La razón por la que este enfoque es práctico y potente radica en que, incluso cuando llegan datos de nuevas especies u organizaciones, no es necesario volver a entrenar el clasificador desde cero; simplemente se pueden transferir directamente las etiquetas del atlas celular existente.

Mapeo CS

  • Espacio de incrustación compartido (shared embedding space): Alinear individuos de diferentes dominios (especies) en un único espacio vectorial común es estructuralmente idéntico a la creación de incrustaciones compartidas entre idiomas en el procesamiento del lenguaje natural multilingüe para la transferencia interlingüística.
  • Alineación indirecta mediante mapeo indirecto: La estrategia de utilizar secuencias de proteínas como puente intermedio, en lugar de mapear directamente los nombres de los genes, es un patrón de diseño similar al de unir (join) dos bases de datos con esquemas diferentes a través de identificadores comunes.
  • Transferencia de etiquetas zero-shot: El método de clasificar datos sin etiquetas mediante la comparación de vecinos más cercanos se basa en el mismo principio fundamental que la clasificación por k-vectores más cercanos (k-NN).

Defectos frecuentes

  • Sobreconfianza en genes con relaciones homólogas poco claras: Los grupos de genes que evolucionan rápidamente pueden mostrar baja similitud en las incrustaciones de proteínas; por lo tanto, no se debe asumir que el alineamiento entre especies funciona igual de bien para todos los pares de genes.
  • Aceptación sin validación de los resultados de la transferencia de etiquetas zero-shot: Si existen nuevos tipos celulares en los datos de consulta que no están presentes en el atlas de referencia, el modelo podría asignar forzosamente la etiqueta existente más cercana. Se requiere una validación cruzada independiente, como la verificación de la expresión de genes marcadores.

Para profundizar más

El texto ha sido reescrito directamente por el equipo de investigación de BPD. Profundice consultando el artículo original y los materiales oficiales.

  • Artículo original de UCE: Rosen et al. (2026), Universal cell embedding provides a foundation model for cell biology, Nature. doi:10.1038/s41586-026-10689-z.
  • Contexto de las incrustaciones de proteínas ESM: F11 (esm2-protein-language-embeddings).

En el siguiente capítulo (F24), se abordarán las técnicas de ajuste fino LoRA y PEFT para manejar modelos grandes preentrenados en GPUs a escala de laboratorio real.

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...