연구 질문을 변수로 번역하기
이 토픽을 마치면
연구 질문을 읽고 결과로 측정할 값(outcome), 비교하거나 설명할 조건(exposure), 함께 기록할 공변량(covariate), 행을 구분하는 식별자(identifier)를 나눌 수 있습니다. 또한 표의 한 행이 무엇을 의미하는지 먼저 결정한 뒤, 그 질문에 맞는 데이터 계약의 초안을 만들 수 있습니다.
출발점: 질문에는 아직 열 이름이 없습니다
다음과 같은 질문을 생각해 보겠습니다.
서로 다른 처리 조건에서 얻은 측정값은 어떻게 달라지는가?
이 문장은 연구의 방향을 보여주지만, 바로 분석할 수 있는 표는 아닙니다. “측정값”이 무엇인지, 처리 조건이 어느 단위에 배정됐는지, 한 조건에서 독립적인 단위가 몇 개인지 알 수 없기 때문입니다. 질문을 데이터로 옮기는 첫 단계는 통계 기법을 고르는 일이 아니라, 문장 속 역할을 분리하는 일입니다.
이때 특정 처리의 생물학적 효과를 미리 확정하지 않습니다. 데이터 설계가 허용하는 질문의 범위를 먼저 정해야, 뒤에서 계산한 수치가 무엇을 말하는지 과장하지 않을 수 있습니다.
한 행의 의미부터 결정하기
표를 만들기 전에 “한 행은 무엇인가?”에 답해야 합니다. 한 행이 독립적인 배양 단위일 수도 있고, 같은 단위에서 반복 측정한 한 번의 측정일 수도 있습니다. 두 표는 모두 유효한 표현이지만, 행의 의미가 다르면 같은 열 이름을 사용해도 분석 단위가 달라집니다.
예를 들어 한 독립 단위에서 세 번의 기술적 측정을 했다면, 다음 두 표현이 가능합니다.
| culture_id | treatment | measurement_id | value |
|---|---|---|---|
| C01 | A | M01 | 0.82 |
| C01 | A | M02 | 0.79 |
| C01 | A | M03 | 0.81 |
이 표의 세 행은 세 번의 관측을 기록하지만, culture_id 수준에서 처리 조건이 배정됐다면 독립적인 처리 단위가 세 개가 되는 것은 아닙니다. 관측값의 개수와 독립 정보의 개수는 별도로 기록해야 합니다. biological replicate, technical replicate, experimental unit의 구분은 이후의 요약과 추론에 직접 영향을 줍니다. 이 문제는 다음 토픽에서 집중적으로 다룹니다.
질문을 네 종류의 열로 번역하기
outcome: 무엇을 측정해 답할 것인가
outcome은 연구 질문에서 결과로 관찰하는 값입니다. 연속적인 측정값일 수도 있고, 사건의 발생 여부나 횟수일 수도 있습니다. 중요한 점은 이름보다 측정 규칙입니다. 값의 단위, 측정 시점, 허용 범위, 결측 표현을 함께 기록해야 합니다.
“성장”이라고 쓰는 것만으로는 충분하지 않습니다. 특정 시점의 세포 수인지, 기준 시점 대비 변화량인지, 이미지에서 얻은 면적 지표인지에 따라 outcome의 의미가 달라집니다. 같은 value라는 열 이름이라도 측정 정의가 다르면 하나의 분석에 섞어서는 안 됩니다.
exposure: 무엇을 비교하거나 설명할 것인가
exposure는 관찰 결과를 비교할 조건 또는 설명 변수입니다. 실험에서는 처리 조건이나 용량, 관찰 연구에서는 노출 수준이나 집단 구분처럼 표현될 수 있습니다. 범주형인지 수치형인지, 연구 시작 전에 정해졌는지, 측정 후에 계산된 값인지도 확인합니다.
다만 exposure를 적었다고 해서 결과에 대한 인과 효과가 자동으로 정의되는 것은 아닙니다. 처리 배정 방식, 시간 순서, 교란 가능성, 분석 단위가 함께 검토되어야 합니다. 이 토픽에서는 질문을 변수로 번역하는 범위까지만 다루고, 인과 결론은 만들지 않습니다.
covariate: 함께 기록할 맥락
covariate는 outcome과 exposure를 해석할 때 함께 고려할 수 있는 변수입니다. 배치, 측정 시점, 초기 상태처럼 연구 설계와 측정 과정의 맥락을 나타낼 수 있습니다. 모든 기록값이 자동으로 covariate가 되는 것은 아닙니다. 질문과 시간 순서에 맞지 않거나, 결과를 본 뒤 만들어진 값이라면 해석을 바꿀 수 있습니다.
따라서 “열이 많을수록 좋은 데이터”라고 생각하지 않습니다. 각 열에 대해 왜 기록했는지, 어떤 단위에 속하는지, 분석에서 어떤 역할을 할 수 있는지 설명할 수 있어야 합니다.
identifier: 행과 단위를 구분하는 이름
identifier는 관측값 또는 연구 단위를 구분하기 위한 값입니다. culture_id, batch_id, measurement_id처럼 여러 수준의 ID가 있을 수 있습니다. ID는 중복을 찾고 그룹 구조를 확인하는 데 중요하지만, 그 자체를 생물학적 크기나 효과로 해석하지 않습니다.
특히 숫자로 된 ID를 연속형 변수처럼 모델에 넣지 않도록 주의합니다. culture_id=10이 culture_id=5보다 다섯 배 큰 상태를 뜻하지 않는다면, 그 숫자는 순서와 크기를 가진 측정값이 아니라 이름입니다.
작은 데이터 계약 작성하기
변수를 정했다면 다음과 같은 계약을 먼저 씁니다.
| 열 | 역할 | 자료형 | 단위 또는 허용값 | 한 행에서의 의미 |
|---|---|---|---|---|
unit_id | identifier | 문자열 | 고유 ID | 독립 연구 단위 |
treatment | exposure | 범주형 | A, B | 단위에 배정된 조건 |
batch | covariate 후보 | 범주형 | 사전 정의된 배치 ID | 측정·처리 맥락 |
outcome | outcome | 실수 | 사전에 정한 단위 | 한 시점의 측정값 |
이 표는 분석 결과가 아니라 분석 전에 세우는 약속입니다. outcome의 측정 단위와 시점, treatment의 배정 수준, 반복 측정의 존재를 모르면 계약은 아직 완성되지 않은 것입니다. 누락된 정보는 채워 넣기보다 확인 목록으로 남깁니다.
연구 질문으로 돌아가 해석하기
변수로 번역한 뒤에는 질문을 다시 읽습니다.
- 내가 비교하려는 조건은
exposure로 표현됐는가? - 결과의 측정 정의와 단위가
outcome에 적혀 있는가? - 한 행의 단위와 처리 배정 단위가 구분되어 있는가?
- 반복 측정과 배치 정보가 식별 가능한가?
- 이 표가 답하는 질문과 답하지 못하는 질문은 무엇인가?
이 점검을 통과했다고 해서 처리 조건의 효과가 입증되는 것은 아닙니다. 아직 계산 방법, 불확실성, 연구설계의 제약을 검토하지 않았기 때문입니다. 여기서 얻는 성과는 질문을 분석 가능한 언어로 바꾼 것이며, 결론을 미리 얻은 것이 아닙니다.
자주 생기는 실패와 점검법
첫째, 모든 열을 “변수”라고 부르면서 역할을 구분하지 않는 경우입니다. outcome과 identifier를 구분하지 않으면 ID의 숫자 크기에 의미를 부여할 수 있습니다.
둘째, 한 행을 한 번의 측정으로 정한 뒤 그 행들을 모두 독립 반복으로 세는 경우입니다. 처리 배정 단위와 측정 단위가 다를 수 있으므로, 반복 구조를 별도 열로 보존해야 합니다.
셋째, 질문을 데이터에 맞춰 사후적으로 바꾸는 경우입니다. 분석 전에 질문과 변수 역할을 기록하고, 변경이 필요하면 무엇이 왜 바뀌었는지 남겨야 합니다.
핵심 정리
- 연구 질문은 outcome, exposure, covariate, identifier의 역할로 번역할 수 있습니다.
- 한 행의 의미와 처리 배정 단위를 먼저 정해야 합니다.
- ID는 단위를 구분하는 이름이며 자동으로 분석 변수나 효과가 되지 않습니다.
- 변수 계약에는 자료형, 단위, 허용값, 반복 구조가 포함되어야 합니다.
- 변수표를 만들었다고 해서 인과나 생물학적 중요성이 확정되는 것은 아닙니다.
다음 토픽으로
다음 편에서는 같은 표 안에 있는 관측값, 실험단위, biological replicate, technical replicate를 구분합니다. 특히 한 독립 단위의 반복 측정을 표본 수로 잘못 세는 pseudoreplication 문제를 다룹니다.
참고 자료
- Bioconductor OSTA, experimental design: https://bioconductor.org/books/release/OSTA/pages/bkg-exp-design.html
- ASA GAISE Reports: https://www.amstat.org/education/guidelines-for-assessment-and-instruction-in-statistics-education-%28gaise%29-reports
본 편의 설명, 표, 시나리오는 BioStatPy가 독립적으로 작성한 교육용 구성입니다. 외부 자료의 문장·표현·예제 배열을 재현하지 않습니다.