목록으로

compositional data와 log-ratio

마이크로바이옴처럼 합이 제한된 compositional data에서 가짜 상관이 생기는 이유와 CLR 등 log-ratio 분석의 원리를 설명합니다.

심화
|
35
|
검증 완료 (2026-08-07)
BioStatPycompositional dataCLR 변환log-ratio마이크로바이옴 통계
진행률0/33 (0%)

compositional data와 log-ratio

이 토픽을 마치면

전체 합이 제한된 비율·구성자료에서 한 부분의 증가와 다른 부분의 감소가 얽힐 수 있음을 설명할 수 있습니다. closure 문제를 인식하고, log-ratio 관점을 사용하기 전에 zero·측정 단위·분모를 확인할 수 있습니다.

전체의 일부로 관측되는 데이터

구성자료는 여러 부분이 하나의 전체를 이루는 비율이나 양으로 표현됩니다. 한 샘플에서 feature별 비율의 합이 일정하다면, 한 부분이 늘었다는 관찰은 실제 그 부분의 절대량 증가뿐 아니라 다른 부분의 상대적 감소로도 나타날 수 있습니다.

Aitchison의 compositional data 연구는 simplex를 표본공간으로 보고, 전체를 이루는 부분들의 관계를 원래 좌표의 단순 상관이 아니라 비율과 변환의 관점에서 다룹니다. 이 편에서는 그 문제의식과 log-ratio 방향만 소개하며, 특정 오믹스 도구를 보편 처방으로 제시하지 않습니다.

closure와 분모

text
sample A: [0.20, 0.30, 0.50]
sample B: [0.10, 0.30, 0.60]

두 벡터의 합은 1입니다. 각 부분의 값만 비교하기 전에 전체 분모와 측정 과정이 무엇인지 확인해야 합니다. library size나 sequencing depth를 단순히 feature의 독립적인 생물학적 양으로 읽지 않습니다.

log-ratio 관점

부분 i와 j의 상대 관계는 log(x_i / x_j)처럼 표현할 수 있습니다. 비율의 분자를 기준으로 바꾸면 해석이 달라질 수 있으므로, 어떤 denominator와 변환을 선택했는지 기록합니다. centered log-ratio처럼 전체 기하평균과 비교하는 변환도 있지만, zero가 있으면 로그를 바로 계산할 수 없습니다.

zero와 preprocessing

0은 실제 부재, 검출한계 이하, 측정 실패, filtering 결과일 수 있습니다. 따라서 작은 상수를 자동으로 더해 로그를 계산하지 않습니다. zero 처리 규칙과 근거, 변환 전후 자료를 별도로 보존합니다.

연구 질문으로 돌아가 해석하기

log-ratio 분석은 구성비의 상대 관계를 질문에 맞게 표현하는 방법입니다. 이를 절대량의 증거나 생물학적 기전으로 자동 번역하지 않습니다. 분모, sampling 과정, batch, replicate와 함께 해석합니다.

자주 생기는 실패

  • 비율 합이 제한된 자료를 독립적인 연속변수 모음으로 취급하지 않습니다.
  • closure를 무시하고 feature별 상관을 원인으로 읽지 않습니다.
  • zero에 작은 값을 자동으로 더하지 않습니다.
  • log-ratio의 분모와 단위를 기록하지 않습니다.

핵심 정리

  • compositional data는 전체와 부분의 제약을 함께 가집니다.
  • 한 부분의 상대적 증가는 다른 부분과의 비율 관계입니다.
  • log-ratio는 그 상대 관계를 표현하는 관점입니다.
  • zero·분모·측정 과정을 확인한 뒤 변환을 선택합니다.

다음 토픽으로

다음 편에서는 PCA와 고차원 QC로 연결해, 전처리와 batch가 저차원 표현에 미치는 영향을 봅니다.

참고 자료

본 편의 수치와 구성자료 예시는 BioStatPy가 독립적으로 작성했습니다.

💬 질문과 댓글

0개의 댓글

로그인 없이 작성할 수 있습니다. 비로그인 댓글은 작성 후 직접 수정·삭제할 수 없습니다.

0/2000

로딩 중...