Has oído hablar de todos ellos, pero ¿no sabes cuándo usar cada uno?
TCGA, GTEx, cBioPortal y GEPIA2 se mencionan constantemente en conferencias y artículos de bioinformática, pero si no se distingue claramente qué base de datos es para cada propósito, incluso para verificar una sola frase como "este gen tiene una alta expresión en el tumor", uno se sentirá perdido sin saber por dónde empezar. En D04, dividimos claramente las funciones de estas cuatro herramientas y abordamos el orden real en el que se deben combinar y utilizar.
Principio — La base de datos original y la capa de consulta sobre ella
TCGA — El repositorio original del genoma tumoral
TCGA (The Cancer Genome Atlas) es la base de datos original que contiene datos genómicos, transcriptómicos y clínicos de más de 10,000 pacientes de 33 tipos de cáncer. Contiene datos de expresión, mutación y variación en el número de copias (CNV) de tejido tumoral, pero los datos de tejido normal son relativamente escasos, ya que, por definición, es un proyecto destinado a la recolección de tejidos de pacientes con cáncer.
GTEx — La línea base de la expresión en tejido normal
Por el contrario, GTEx (Genotype-Tissue Expression) es un proyecto que recolectó a gran escala datos de expresión de tejido normal de donantes post-mortem en 54 tipos de tejidos. Solo con TCGA, no es posible distinguir si "este gen es alto en el tumor o si siempre es alto en ese tejido"; GTEx proporciona ese punto de referencia para la comparación.
cBioPortal — Interfaz de exploración con datos clínicos integrados
cBioPortal es una interfaz que permite explorar directamente en la web diversos conjuntos de datos de investigación genómica, incluyendo TCGA, junto con información clínica (supervivencia, estadio, respuesta al tratamiento). Preguntas como "¿la curva de supervivencia del grupo de pacientes con mutación en este gen es diferente a la del grupo sin mutación?" pueden verificarse con unos pocos clics, sin necesidad de código.
GEPIA2 — Una capa que ya ha unido TCGA y GTEx
GEPIA2 (Gene Expression Profiling Interactive Analysis) es una herramienta de consulta diseñada para comparar los datos de RNA-seq de TCGA y GTEx bajo un sistema de procesamiento consistente. El usuario puede visualizar diagramas de caja (boxplots) de comparación tumor-normal usando solo un símbolo genético, sin necesidad de descargar cada base de datos por separado y mapear los tejidos. Sin embargo, el hecho de que hayan sido procesados con el mismo pipeline no significa que se hayan eliminado los efectos de lote (batch effects) y las variables de confusión derivados de diferentes cohortes y condiciones de recolección. Tras una comparación exploratoria, es necesario verificar la composición de las muestras y las covariables.
Práctica: Verificar la expresión de BRCA1 con cuatro herramientas (web)
1. GEPIA2 (gepia2.cancer-pku.cn): "Expression Analysis" → introducir el símbolo génico "BRCA1"
→ ver de inmediato el diagrama de cajas de tumor de mama (BRCA) frente a tejido mamario normal de GTEx
2. cBioPortal (cbioportal.org): seleccionar el estudio "TCGA Breast Cancer" → buscar "BRCA1"
→ consultar la curva de supervivencia Kaplan-Meier de pacientes con variante frente a pacientes sin ella
3. GTEx Portal (gtexportal.org): buscar "BRCA1" → diagrama de violín de expresión en 54 tejidos
→ comprobar también la expresión basal en tejidos distintos de la mama
4. Si se necesitan los datos originales de TCGA (por ejemplo, para reanalizar directamente los recuentos brutos):
descargarlos desde GDC Data Portal (portal.gdc.cancer.gov)Al seguir estos cuatro pasos en orden, se revela que la misma pregunta sobre "cómo se manifiesta BRCA1 en el cáncer de mama" recibe respuestas distintas según la herramienta utilizada: GEPIA2 desde la perspectiva de la expresión génica (GE), cBioPortal desde la perspectiva del pronóstico clínico, GTEx desde la perspectiva comparada con tejidos normales y TCGA desde la perspectiva del reanálisis original.
Mapeo CS
- Integración del catálogo de datos: La estructura de GEPIA2, que agrupa múltiples bases de datos originales en una única interfaz de consulta, es un patrón estándar de ingeniería de datos para integrar varios sistemas fuente en un solo catálogo.
- Diseño de claves de unión: Para comparar TCGA y GTEx se necesitan claves de unión que alineen los tipos de tejido y los sistemas de identificadores de genes; este es un problema que siempre surge al conectar bases de datos con esquemas diferentes.
- Capa de preprocesamiento en caché: El hecho de que GEPIA2 proporcione resultados de procesamiento consistentes de antemano se asemeja al diseño de una capa de caché que prepara los datos para consultas frecuentes en lugar de recalcularlos desde el origen cada vez. Esto no garantiza la eliminación del efecto lote entre cohortes.
Defectos comunes
- Adoptar directamente las cajas y bigotes de GEPIA2 como conclusiones estadísticamente significativas: GEPIA2 es una herramienta exploratoria, no un análisis estadístico definitivo que controle completamente la corrección por pruebas múltiples ni los factores de confusión específicos de cada cohorte. Para conclusiones importantes se requiere un reanálisis directo con los datos originales (como DESeq2 en S19).
- Usar la expresión "comparado con tejidos normales" basándose únicamente en los datos de TCGA: Las muestras de tejido normal propias de TCGA son escasas y suelen ser tejidos normales adyacentes al tumor, por lo que difieren en naturaleza de GTEx, que sirve como línea base de tejidos sanos verdaderamente normales. Es importante no confundir estos dos conceptos.
Para profundizar más
El texto ha sido reescrito directamente por el equipo de investigación de BPD.
- Portal de datos GDC oficial de TCGA: Descarga de datos genómicos y clínicos originales.
- Documentación oficial del portal GTEx: Métodos para acceder a los datos de expresión por tejido.
- Documentación oficial de cBioPortal: Uso de la interfaz de exploración integrada de datos clínicos y genómicos.
- Artículo original de GEPIA2 (Tang et al., 2019, Nucleic Acids Research).
En el siguiente capítulo D05 se tratarán las estadísticas resumidas a escala del genoma completo en lugar de genes individuales, así como Pan-UK Biobank.