반복측정·군집·의사반복
이 토픽을 마치면
반복측정과 군집자료에서 관측값 사이의 연결을 식별할 수 있습니다. 독립 단위보다 하위 수준의 행을 표본 수로 과대평가하는 의사반복을 찾고, 요약·계층모형·설계 보완을 선택하기 전에 필요한 질문을 정리합니다.
행이 많아도 독립 정보가 많지 않을 수 있다
한 독립 단위에서 여러 시점, 여러 well, 여러 이미지가 생성될 수 있습니다. 데이터프레임에는 많은 행이 생기지만 같은 상위 단위의 값을 공유하므로 서로 독립이라고 볼 수 없는 경우가 있습니다. 반복측정의 핵심은 행의 수가 아니라 연결 구조입니다.
계층 schema
study_id → subject_id → timepoint → measurement_id각 수준이 실제 연구 단위와 맞는지 확인합니다. 처리가 subject_id에 배정됐는데 measurement_id를 독립 반복으로 세면 의사반복 위험이 생깁니다. 같은 subject의 시점들은 시간 순서와 공통 상태를 공유합니다.
군집도 유사합니다. batch, plate, site처럼 공통 환경이나 처리 과정을 공유하는 단위가 있으면 같은 군집의 관측이 서로 더 비슷할 수 있습니다. 군집 ID를 단순한 범주 열로 기록하는 것과 그 상관 구조를 분석에 반영하는 것은 별개의 일입니다.
세 가지 처리 방향
반복의 목적이 측정 오차를 줄이는 것이라면 독립 단위 수준으로 요약할 수 있습니다. 시간·군집별 변화를 모델링하려면 계층구조를 반영하는 방법을 검토할 수 있습니다. 설계가 불명확하면 먼저 연구 기록과 데이터 lineage를 보완합니다.
어떤 방향도 모든 반복자료에 자동 적용되는 규칙은 아닙니다. outcome의 형태, 시점 수, 결측, 배정 수준과 질문에 따라 선택하고 그 이유를 기록합니다.
long format에서 구조 확인하기
반복자료는 subject_id, time, measurement_id, outcome을 한 행에 기록하는 long format으로 표현할 수 있습니다. 같은 subject_id가 여러 행에 나타나는 것은 중복 오류가 아니라 반복 구조일 수 있습니다. subject_id별 시점 수와 결측 위치를 먼저 세면 어떤 상위 단위가 불완전한지 확인할 수 있습니다.
반대로 measurement_id만 있고 상위 단위 ID가 없다면 독립성 구조를 복구하기 어렵습니다. 분석 전에 원자료·실험 노트·plate map에서 상위 ID를 보완하고, 확인할 수 없는 경우 독립성을 임의로 가정하지 않습니다.
그룹별 고유 subject_id 수와 전체 행 수를 나란히 보고하면 관측 수와 독립 단위 수의 차이가 드러납니다. 결과표의 n이 어느 수준을 세는지도 각 표와 그림에 명시합니다.
연구 질문으로 돌아가 해석하기
반복측정 자료의 질문은 “모든 행의 평균이 다른가?”가 아니라 “독립 단위 안의 변화와 독립 단위 사이의 차이를 어떻게 구분할 것인가?”에 가깝습니다. 이를 구분하지 않으면 불확실성을 지나치게 작게 계산할 수 있습니다.
자주 생기는 실패
- subject의 여러 시점을 독립 표본으로 세지 않습니다.
- 같은 plate의 well을 자동으로 독립으로 취급하지 않습니다.
- 반복값을 임의 평균내고 시간 정보를 잃지 않습니다.
- mixed model을 구조 확인 없이 자동 지정하지 않습니다.
핵심 정리
- 반복측정·군집자료의 핵심은 상위 단위와 연결 구조입니다.
- 행 수는 독립 정보량과 같지 않을 수 있습니다.
- 요약·계층모형·설계 보완은 질문과 구조에 따라 결정합니다.
다음 토픽으로
다음 편부터 OLS와 공변량·진단으로 이동합니다.
참고 자료
- Bioconductor OSTA experimental design: https://bioconductor.org/books/release/OSTA/pages/bkg-exp-design.html
본 편의 계층 schema와 설명은 BioStatPy가 독립적으로 작성했습니다.