compositional data와 log-ratio
이 토픽을 마치면
전체 합이 제한된 비율·구성자료에서 한 부분의 증가와 다른 부분의 감소가 얽힐 수 있음을 설명할 수 있습니다. closure 문제를 인식하고, log-ratio 관점을 사용하기 전에 zero·측정 단위·분모를 확인할 수 있습니다.
전체의 일부로 관측되는 데이터
구성자료는 여러 부분이 하나의 전체를 이루는 비율이나 양으로 표현됩니다. 한 샘플에서 feature별 비율의 합이 일정하다면, 한 부분이 늘었다는 관찰은 실제 그 부분의 절대량 증가뿐 아니라 다른 부분의 상대적 감소로도 나타날 수 있습니다.
Aitchison의 compositional data 연구는 simplex를 표본공간으로 보고, 전체를 이루는 부분들의 관계를 원래 좌표의 단순 상관이 아니라 비율과 변환의 관점에서 다룹니다. 이 편에서는 그 문제의식과 log-ratio 방향만 소개하며, 특정 오믹스 도구를 보편 처방으로 제시하지 않습니다.
closure와 분모
sample A: [0.20, 0.30, 0.50]
sample B: [0.10, 0.30, 0.60]두 벡터의 합은 1입니다. 각 부분의 값만 비교하기 전에 전체 분모와 측정 과정이 무엇인지 확인해야 합니다. library size나 sequencing depth를 단순히 feature의 독립적인 생물학적 양으로 읽지 않습니다.
log-ratio 관점
부분 i와 j의 상대 관계는 log(x_i / x_j)처럼 표현할 수 있습니다. 비율의 분자를 기준으로 바꾸면 해석이 달라질 수 있으므로, 어떤 denominator와 변환을 선택했는지 기록합니다. centered log-ratio처럼 전체 기하평균과 비교하는 변환도 있지만, zero가 있으면 로그를 바로 계산할 수 없습니다.
zero와 preprocessing
0은 실제 부재, 검출한계 이하, 측정 실패, filtering 결과일 수 있습니다. 따라서 작은 상수를 자동으로 더해 로그를 계산하지 않습니다. zero 처리 규칙과 근거, 변환 전후 자료를 별도로 보존합니다.
연구 질문으로 돌아가 해석하기
log-ratio 분석은 구성비의 상대 관계를 질문에 맞게 표현하는 방법입니다. 이를 절대량의 증거나 생물학적 기전으로 자동 번역하지 않습니다. 분모, sampling 과정, batch, replicate와 함께 해석합니다.
자주 생기는 실패
- 비율 합이 제한된 자료를 독립적인 연속변수 모음으로 취급하지 않습니다.
- closure를 무시하고 feature별 상관을 원인으로 읽지 않습니다.
- zero에 작은 값을 자동으로 더하지 않습니다.
- log-ratio의 분모와 단위를 기록하지 않습니다.
핵심 정리
- compositional data는 전체와 부분의 제약을 함께 가집니다.
- 한 부분의 상대적 증가는 다른 부분과의 비율 관계입니다.
- log-ratio는 그 상대 관계를 표현하는 관점입니다.
- zero·분모·측정 과정을 확인한 뒤 변환을 선택합니다.
다음 토픽으로
다음 편에서는 PCA와 고차원 QC로 연결해, 전처리와 batch가 저차원 표현에 미치는 영향을 봅니다.
참고 자료
- Aitchison (1982), The Statistical Analysis of Compositional Data: https://doi.org/10.1111/j.2517-6161.1982.tb01195.x
- Bioconductor OSTA experimental design: https://bioconductor.org/books/release/OSTA/pages/bkg-exp-design.html
본 편의 수치와 구성자료 예시는 BioStatPy가 독립적으로 작성했습니다.