Broad MPG — 큰 데이터보다 협업 구조를 읽기
왜 알아야 하는가
복합질환의 유전학은 sequencing 한 대나 분석법 하나로 해결되지 않습니다. 수십만 명의 genotype과 phenotype을 다루려면 population genetics, 통계학, 분자생물학, 임상의학, bioinformatics와 데이터 거버넌스가 연결돼야 합니다. Broad Institute의 Medical and Population Genetics(MPG)는 이런 협업 구조를 보여주는 사례입니다.
기관이나 프로그램을 소개할 때 유명 인물과 큰 표본 수만 나열하면 실제 지식 생산 과정을 놓칩니다. 연구 질문, cohort, phenotype 정의, 분석 infrastructure와 후속 기능검증이 어떻게 맞물리는지를 봐야 합니다.
Population genetics가 묻는 것
인구 집단에는 공통 variant와 희귀 variant, ancestry와 demographic history가 만든 allele-frequency 차이가 있습니다. 질병 association을 찾을 때 이 구조를 조정하지 않으면 집단 차이가 질병 원인처럼 보일 수 있습니다. 반대로 지나치게 단순한 ancestry category는 연속적인 유전 다양성과 사회적 맥락을 왜곡할 수 있습니다.
large cohort는 작은 effect를 찾고 희귀 변이 보유자를 모을 기회를 늘립니다. 하지만 표본 수가 phenotype 오류, selection bias와 불균등한 대표성을 자동으로 상쇄하지는 않습니다.
Phenotype이 분석을 결정한다
같은 diabetes, depression 또는 cardiovascular disease label도 진단코드, 설문, 약물, 검사값과 전문의 판정에 따라 다른 phenotype이 됩니다. case와 control 정의가 섞이면 genetic effect가 희석되거나 의료 접근성 차이가 association에 들어갈 수 있습니다.
EHR 기반 연구에서는 care pathway와 missingness가 특히 중요합니다. 병원에 자주 오는 사람이 더 많은 검사를 받아 phenotype이 더 잘 발견되는 ascertainment bias를 고려해야 합니다.
발견에서 기전까지
GWAS와 rare-variant set test는 disease-associated locus나 gene을 제안합니다. fine-mapping, eQTL과 chromatin 자료로 가능한 target gene을 좁히고, cellular·animal model과 기능시험으로 기전을 검증합니다. 계산 신호와 기능적 인과 사이에는 여러 독립 단계가 있습니다.
한 팀이 모든 단계를 수행하기보다 cohort와 통계, 실험과 임상 전문성이 공동의 data model과 provenance 위에서 협업합니다. 재현 가능한 code와 data access policy도 과학적 방법의 일부입니다.
대규모 WGS의 실제 조건
표본 수 외에도 coverage, joint calling, sample identity, ancestry-aware QC와 relatedness 처리가 필요합니다. storage와 compute pipeline의 version이 바뀌면 결과도 달라질 수 있습니다. rare variant 분석은 batch 간 callability 차이에 특히 민감합니다.
민감한 genome과 건강정보는 consent, controlled access, privacy와 community engagement 아래 사용해야 합니다. 데이터 공유의 속도와 참여자의 권리를 동시에 설계해야 합니다.
세미나와 공식 근거 구분
연구 현장의 세미나와 개인적 기억은 과학이 만들어지는 분위기를 보여주는 Story 소재가 될 수 있습니다. 그러나 공식 기록 없는 발언을 특정 연구자의 확정 주장으로 복원하면 안 됩니다. 프로그램의 현재 역할은 공식 페이지·논문과 공개된 연구 산출물로 확인합니다.
혼동하기 쉬운 점
- 큰 cohort는 대표성 있는 cohort와 같지 않습니다.
- association locus는 causal gene과 같지 않습니다.
- ancestry는 인종이라는 고정 생물학 범주와 같지 않습니다.
- 데이터 공유는 무제한 공개를 뜻하지 않습니다.
- 기관의 성과를 개인 한 명의 통찰로만 설명하면 협업 infrastructure를 지웁니다.
해석 경계
대규모 유전학의 신뢰도는 표본 수, phenotype, representation, QC, compute, governance와 독립 재현의 결합에서 나옵니다. 이 글은 특정 기관의 모든 활동이나 개별 연구 결과를 포괄하지 않습니다.
연결해서 읽기
희귀변이 association은 SKAT, GWAS 기전 연결은 eQTL과 Non-coding GWAS, 국가 의료체계 통합은 UK genomic medicine ecosystem Concept으로 이어집니다.