SKAT — 희귀변이를 하나씩 보지 않는 이유
왜 희귀변이는 묶어서 보는가
흔한 variant는 각 genotype 집단에 충분한 사람이 있어 한 위치씩 association을 검정할 수 있습니다. 희귀 variant는 대부분의 사람이 reference allele을 가지고 변이 보유자가 매우 적어, 실제 효과가 있어도 단일-variant 검정의 통계력이 부족합니다. 그래서 생물학적으로 관련된 variant를 gene, pathway 또는 regulatory region 단위의 set으로 묶어 phenotype과의 전체 연관을 묻습니다.
묶는다고 정보가 자동으로 좋아지는 것은 아닙니다. 어떤 variant를 포함할지, 기능 annotation과 minor allele frequency 기준을 어떻게 둘지가 검정 가설 자체를 결정합니다. 서로 무관한 variant를 많이 섞으면 신호가 희석되고, 결과를 본 뒤 유리한 set만 고르면 type I error가 커집니다.
Burden test와 SKAT의 다른 질문
Burden test는 set 안의 rare allele을 한 점수로 합칩니다. 포함 변이의 효과가 비슷한 방향이고 크기도 어느 정도 일관될 때 강합니다. 반대로 보호 효과와 위험 효과가 섞이거나 비인과 variant가 많으면 서로 상쇄되거나 noise가 커질 수 있습니다.
SKAT은 variant별 score를 kernel 안에서 결합해 효과의 방향과 크기가 달라도 신호를 포착하도록 설계됐습니다. 그 유연성은 모든 상황에서 우월하다는 뜻이 아닙니다. 실제 효과가 같은 방향으로 모여 있으면 burden test가 더 강할 수 있습니다.
SKAT-O는 burden과 SKAT의 조합 범위를 탐색해 자료에 적합한 균형을 찾습니다. 선택 과정까지 보정하지만, 잘못 정의된 variant set이나 phenotype model을 고쳐 주는 자동 정답은 아닙니다.
분석 설계의 핵심 부품
variant weight는 보통 더 희귀한 allele에 큰 값을 주지만 frequency만으로 기능적 중요성을 보증할 수 없습니다. loss-of-function, missense, regulatory variant를 같은 set에 넣을지 사전에 정하고 annotation 오류와 transcript 선택을 점검해야 합니다. MAF threshold는 cohort 내부와 외부 reference에서 일관되게 정의합니다.
binary phenotype에는 case–control 불균형, quantitative trait에는 분포와 outlier가 영향을 줍니다. ancestry principal components, relatedness와 sequencing batch를 조정하지 않으면 population structure나 기술 차이가 유전 신호처럼 보일 수 있습니다. 한 사람이 여러 cohort에 중복되는 문제도 독립성을 깨뜨립니다.
작은 예시
어떤 효소 유전자의 희귀 coding variant들이 질병 위험에 영향을 준다고 가정합시다. 대부분이 기능을 낮춰 같은 방향으로 작용한다면 burden test가 효과를 모아 잘 찾을 수 있습니다. 일부는 기능을 높이고 일부는 낮추며 무관한 missense도 섞여 있다면 SKAT이 더 적합할 수 있습니다.
set-level p-value가 유의해도 어느 variant가 causal인지, 몇 명의 phenotype을 설명하는지 알 수 없습니다. leave-one-out 분석, variant-level 자료, 독립 cohort 재현과 기능시험이 뒤따라야 합니다.
Multiple testing과 재현
여러 gene, annotation mask, MAF cutoff와 phenotype을 검사하면 각 조합이 하나의 분석 기회입니다. 사전에 primary analysis를 정하고 전체 탐색 수에 맞게 multiple testing을 보정해야 합니다. discovery cohort의 유의성을 같은 ancestry와 독립 ancestry 자료에서 재현하고 effect heterogeneity를 확인합니다.
희귀변이는 sequencing platform과 variant calling 품질에 민감합니다. case와 control을 다른 기술로 생성하면 batch artifact가 set 안에 누적될 수 있으므로 joint QC와 callability 비교가 필요합니다.
혼동하기 쉬운 점
- 유의한 gene set은 진단 유전자 확정이나 임상 actionability를 뜻하지 않습니다.
- SKAT-O가 여러 모형을 조합해도 모든 genetic architecture를 포괄하지 않습니다.
- 큰 표본도 phenotype 정의와 ancestry representation이 나쁘면 편향을 없애지 못합니다.
- annotation 기반 mask는 생물학적 가설이며 객관적인 전처리 항목만은 아닙니다.
해석 경계
SKAT 계열은 population-level association 도구입니다. 결과는 개별 변이의 병원성이나 특정 환자의 진단을 판정하지 않습니다. set 정의, weight, phenotype model, ancestry·relatedness와 전체 분석 계획을 함께 공개할 때 재현 가능한 근거가 됩니다.
연결해서 읽기
variant-level 기능 증거는 기능시험과 변이 해석, 대규모 population 연구 설계는 Broad Medical and Population Genetics Concept과 연결됩니다.