이름은 다 들어봤는데, 언제 뭘 써야 할지 헷갈린다면
TCGA, GTEx, cBioPortal, GEPIA2는 바이오인포매틱스 강의·논문에서 계속 언급되지만, 각각 무엇을 위한 데이터베이스인지 명확히 구분하지 않으면 "종양에서 이 유전자가 높게 발현된다"는 문장 하나를 검증하는 데도 어디서 시작해야 할지 막막해집니다. D04에서는 이 네 도구의 역할을 명확히 나누고, 실제로 어떤 순서로 조합해 쓰는지를 다룹니다.
원리 — 원본 데이터베이스와 그 위의 조회 계층
TCGA — 종양 유전체의 원본 저장소
TCGA(The Cancer Genome Atlas)는 33개 암종, 1만 건 이상 환자의 유전체·전사체·임상 데이터를 담은 원본 데이터베이스입니다. 여기엔 종양 조직의 발현·변이·복제수변이(CNV) 데이터가 있지만, 정상조직 데이터는 상대적으로 적습니다 — 애초에 암 환자 조직을 수집하는 프로젝트이기 때문입니다.
GTEx — 정상조직 발현의 기준선
GTEx(Genotype-Tissue Expression)는 반대로 사후 기증자의 정상조직 발현 데이터를 54개 조직에 걸쳐 대규모로 수집한 프로젝트입니다. TCGA만으로는 "이 유전자가 종양에서 높은 건지, 원래 그 조직에서 항상 높은 건지" 구분할 수 없는데, GTEx가 그 비교 기준선을 제공합니다.
cBioPortal — 임상 데이터까지 얹은 탐색 인터페이스
cBioPortal은 TCGA를 비롯한 여러 유전체 연구 데이터셋을 임상 정보(생존율·병기·치료 반응)와 함께 웹에서 바로 탐색할 수 있게 만든 인터페이스입니다. "이 유전자에 변이가 있는 환자군의 생존 곡선이 없는 환자군과 다른가?" 같은 질문을 코드 없이 몇 번의 클릭으로 확인할 수 있습니다.
GEPIA2 — TCGA와 GTEx를 이미 조인해둔 계층
GEPIA2(Gene Expression Profiling Interactive Analysis)는 TCGA와 GTEx RNA-seq 데이터를 일관된 처리 체계로 비교할 수 있게 만든 조회 도구입니다. 사용자가 두 데이터베이스를 각각 내려받아 조직을 매핑하지 않아도 유전자 심볼 하나로 종양-정상 비교 박스플롯을 볼 수 있습니다. 그러나 동일 파이프라인으로 처리했다는 사실이 서로 다른 코호트·수집 조건에서 생긴 batch effect와 교란을 제거했다는 뜻은 아닙니다. 탐색적 비교 뒤에는 표본 구성과 공변량을 확인해야 합니다.
실습: BRCA1 발현을 네 도구로 각각 확인해보기 (웹)
1. GEPIA2 (gepia2.cancer-pku.cn): "Expression Analysis" → 유전자 심볼 "BRCA1" 입력
→ 유방암(BRCA) 종양 vs GTEx 정상 유방조직 박스플롯 즉시 확인
2. cBioPortal (cbioportal.org): "TCGA Breast Cancer" 스터디 선택 → "BRCA1" 검색
→ 변이 보유 환자군 vs 비보유 환자군 생존 곡선(Kaplan-Meier) 확인
3. GTEx Portal (gtexportal.org): "BRCA1" 검색 → 54개 조직별 발현량 바이올린 플롯
→ 유방조직 외 다른 조직에서의 기준 발현 수준도 함께 확인
4. TCGA 원본이 필요한 경우(예: 원시 카운트 데이터로 직접 재분석):
GDC Data Portal(portal.gdc.cancer.gov)에서 원본 다운로드이 네 단계를 순서대로 밟아보면, 같은 "BRCA1이 유방암에서 어떻게 나타나는가"라는 질문도 발현량 관점(GEPIA2)·임상 예후 관점(cBioPortal)·정상조직 대비 관점(GTEx)·원본 재분석 관점(TCGA)에서 각각 다른 도구가 답을 준다는 점이 드러납니다.
CS 매핑
- 데이터 카탈로그 통합: 여러 원본 데이터베이스를 하나의 조회 인터페이스로 묶는 GEPIA2의 구조는, 여러 소스 시스템을 하나의 카탈로그로 통합하는 데이터 엔지니어링의 표준 패턴입니다.
- 조인 키 설계: TCGA와 GTEx를 비교하려면 조직 유형·유전자 ID 체계를 일치시키는 조인 키가 필요합니다 — 서로 다른 스키마의 데이터베이스를 연결할 때 항상 등장하는 문제입니다.
- 캐시된 전처리 계층: GEPIA2가 일관된 처리 결과를 미리 제공하는 것은, 매번 원본에서 재계산하는 대신 자주 쓰이는 질의용 데이터를 준비해두는 캐시 계층 설계와 닮았습니다. 이것이 코호트 간 batch effect 제거를 보장하지는 않습니다.
자주 만나는 결함
- GEPIA2의 박스플롯을 통계적으로 유의한 결론으로 바로 채택: GEPIA2는 탐색 도구이지, 다중검정 보정이나 코호트별 교란변수를 완전히 통제한 확정적 통계 분석은 아닙니다. 중요한 결론에는 원본 데이터로 직접 재분석(S19의 DESeq2 등)이 필요합니다.
- TCGA 데이터만 보고 "정상조직 대비"라는 표현을 사용: TCGA 자체 정상조직 샘플은 수가 적고 종양 인접 조직(tumor-adjacent normal)인 경우가 많아, 진짜 건강한 정상조직 기준선인 GTEx와 성격이 다릅니다. 두 개념을 혼동하지 않는 것이 중요합니다.
더 깊게 파고 싶다면
본문은 BPD 연구진이 직접 재구성한 서술입니다.
- TCGA 공식 GDC Data Portal: 원본 유전체·임상 데이터 다운로드.
- GTEx Portal 공식 문서: 조직별 발현 데이터 접근 방법.
- cBioPortal 공식 문서: 임상-유전체 통합 탐색 인터페이스 사용법.
- GEPIA2 원 논문 (Tang et al., 2019, Nucleic Acids Research).
다음 편 D05에서는 개별 유전자가 아니라 전장유전체 스케일의 요약통계, Pan-UK Biobank를 다룹니다.