목록으로

관측단위·실험단위·반복 구분

관측단위와 실험단위를 구분하고 biological replicate, technical replicate, pseudoreplication을 판별해 잘못된 표본 수와 p-value를 피하는 법을 배웁니다.

입문
|
18
|
검증 완료 (2026-08-07)
BioStatPy생물학적 반복기술적 반복실험단위pseudoreplication
진행률0/33 (0%)

관측단위·실험단위·반복 구분

이 토픽을 마치면

측정값이 저장된 행의 단위와 처리 조건이 배정된 실험단위를 구분할 수 있습니다. biological replicate와 technical replicate를 분리하고, 반복 측정이 독립 표본 수를 늘리는지 판단하는 질문을 만들 수 있습니다.

출발점: 측정값 12개가 곧 표본 12개인가

한 연구에서 네 개의 독립적인 배양 단위를 준비하고, 각 단위에서 세 번씩 측정했다고 하겠습니다. 최종 표에는 12개의 값이 들어갑니다. 그렇다면 표본 수는 12일까요?

이 질문에는 숫자만으로 답할 수 없습니다. 처리 조건이 어느 단위에 배정되었는지, 세 번의 측정이 서로 다른 생물학적 단위에서 나온 것인지, 같은 단위의 반복 측정인지 알아야 합니다. 관측값 수는 기록의 개수이고, 독립 정보의 수는 연구설계와 배정 구조에 달려 있습니다.

네 가지 단위를 분리하기

관측단위

관측단위는 값을 한 번 기록하는 대상 또는 측정 수준입니다. 이미지 한 장, well 하나, 한 시점의 측정값처럼 표현될 수 있습니다. 관측단위는 데이터 표의 행과 가까운 개념이지만 항상 같은 것은 아닙니다. 한 행에 여러 측정값을 넓은 형식으로 저장할 수도 있기 때문입니다.

실험단위

실험단위는 처치나 조건이 배정되는 가장 작은 단위입니다. 독립 배양 단위에 조건을 배정했다면 그 배양 단위가 실험단위가 됩니다. 여러 well에 같은 조건을 넣었더라도 실제 배정이 그보다 상위 단위에서 이뤄졌다면, well의 개수만으로 독립적인 처치 단위를 세지 않습니다.

분석 전에 “처리가 어디에 배정됐는가?”를 적는 이유가 여기에 있습니다. 분석법의 이름보다 먼저 assignment의 수준을 보아야 합니다.

Biological replicate

Biological replicate는 서로 독립적인 생물학적 단위에서 얻은 반복입니다. 무엇이 독립 단위인지는 연구 질문과 설계에 따라 정해야 하며, 단순히 ID가 다르다는 이유만으로 결정하지 않습니다. 같은 원천에서 나눈 하위 측정값이 독립적인 생물학적 반복인지도 설계 기록을 확인해야 합니다.

Technical replicate

Technical replicate는 같은 생물학적 단위 또는 같은 실험단위에서 측정 과정의 변동을 살피기 위해 반복한 측정입니다. 기술적 반복은 측정의 안정성을 확인하는 데 유용하지만, 같은 독립 단위에서 나왔다는 사실이 사라지지는 않습니다. 따라서 기술적 반복의 개수를 그대로 biological replicate의 개수로 바꾸지 않습니다.

표에서 계층 구조 읽기

다음은 한 행을 한 측정으로 기록한 long-format 예시입니다.

conditionculture_idwell_idmeasurement_idvalue
AC01W01M010.82
AC01W01M020.79
AC01W02M030.81
BC02W03M040.91
BC02W03M050.94

표의 ID는 서로 다른 수준을 표시합니다. measurement_id는 기록을 구분하고, well_id는 측정이 이뤄진 하위 단위를 구분하며, culture_id는 더 상위의 독립 단위 후보를 표시합니다. 그러나 이 열만 보고 자동으로 독립성을 결론내릴 수는 없습니다. 처리 배정과 시료 생성 과정을 함께 봐야 합니다.

예를 들어 A 조건의 세 행이 모두 culture_id=C01이라면, 세 관측은 세 개의 biological replicate가 아닙니다. 반대로 C01, C02, C03이 서로 독립적으로 조건에 배정되었다면, 각 culture가 독립 단위일 가능성을 설계 기록과 함께 검토할 수 있습니다.

Pseudoreplication이 생기는 지점

Pseudoreplication은 독립적이지 않은 반복을 독립 표본처럼 취급해 정보량을 과대평가하는 문제를 가리킵니다. 대표적인 출발점은 기술적 측정 여러 개를 서로 다른 biological replicate로 세는 것입니다.

이 문제는 단순한 “행 개수 오류”가 아닙니다. 표본 수를 어떤 수준에서 세는지, 변동을 어느 수준에서 추정하는지, 조건의 차이가 어느 단위에서 관찰됐는지를 뒤섞는 문제입니다. 같은 독립 단위의 반복 측정은 측정 변동을 보여줄 수 있지만, 새로운 독립 단위를 만들어내지는 않습니다.

그렇다고 기술적 반복을 항상 버려야 하는 것도 아닙니다. 반복 측정의 목적이 측정 오차 확인인지, 각 하위 단위가 별도의 처치와 독립적인 시료를 갖는지에 따라 처리 방식이 달라집니다. 평균으로 요약할지, 계층 구조를 모델에 반영할지, 설계를 다시 확인할지는 연구 질문과 데이터 구조를 함께 보고 결정합니다.

반복을 처리하는 판단 순서

다음 순서를 기록으로 남깁니다.

  1. 조건 또는 처리가 어느 단위에 배정됐는가?
  2. outcome의 한 값은 어느 단위에서 측정됐는가?
  3. 같은 상위 단위에서 나온 값이 몇 개인가?
  4. 반복은 생물학적 변동을 나타내는가, 측정 과정의 변동을 나타내는가?
  5. 분석의 독립 단위와 보고할 표본 수를 어떻게 정의할 것인가?

이 질문에 답할 때 데이터 표의 행 수를 먼저 세지 않습니다. 연구 노트, 배정 기록, 시료 계보와 데이터 schema가 함께 필요할 수 있습니다. 모르는 상태라면 임의로 독립성을 가정하지 않고 design_unknown으로 남기는 것이 안전합니다.

작은 schema로 확인하기

반복 구조는 다음처럼 데이터 계약에 표현할 수 있습니다.

text
analysis_unit: culture_id
observation_unit: measurement_id
condition_assigned_at: culture_id
technical_repeat_key: well_id
outcome: value

이 schema는 특정 분석법을 강제하지 않습니다. 대신 어떤 수준의 ID를 기준으로 독립성을 검토했는지 보여줍니다. condition_assigned_at이 비어 있으면 처리 조건의 비교를 시작하기 전에 설계 기록을 보완해야 합니다.

연구 질문으로 돌아가 해석하기

“조건 A와 B의 outcome이 다른가?”라는 질문에 답할 때는, A와 B에 속한 행의 개수가 아니라 독립적인 배정 단위의 구조가 핵심입니다. 기술적 반복이 많으면 각 단위의 측정 안정성을 더 자세히 볼 수 있지만, 그것만으로 조건 간 독립 비교의 근거가 늘어나는 것은 아닙니다.

또한 biological replicate라는 표현도 연구의 독립성 전체를 보장하는 표지가 아닙니다. 어떤 단위에서 독립적으로 생성·배정·측정됐는지를 기록하고, 해당 수준과 맞는 요약·모형을 선택해야 합니다. 여기서 아직 평균 비교나 유의성 검정을 선택하지 않는 이유는, 분석 단위가 먼저 정해져야 하기 때문입니다.

자주 생기는 실패와 점검법

“행이 12개이므로 n=12”라고 쓰기

행은 관측 기록의 수일 수 있습니다. n이 무엇을 세는지 분석 문서에 정의하지 않으면, 관측 수와 독립 반복 수를 혼동하게 됩니다.

기술적 반복을 자동으로 삭제하기

반복 측정은 측정 과정의 품질과 변동을 파악하는 데 사용할 수 있습니다. 문제는 반복을 삭제하는 것이 아니라 그 역할을 biological replicate와 구분하지 않는 것입니다.

ID 수준을 확인하지 않고 검정법부터 고르기

그룹별 평균을 비교할지 계층 구조를 모델링할지는 질문과 설계에 따라 달라집니다. 먼저 배정 단위와 반복 구조를 기록한 뒤 방법을 선택합니다.

핵심 정리

  • 관측단위는 값을 기록하는 수준이고, 실험단위는 조건이 배정되는 수준입니다.
  • biological replicate와 technical replicate는 독립성의 의미가 다릅니다.
  • 같은 독립 단위에서 나온 반복 측정은 행 수를 늘리지만 자동으로 독립 표본 수를 늘리지 않습니다.
  • pseudoreplication은 데이터 행, 독립 정보, 분석 단위를 혼동할 때 발생합니다.
  • 분석법 선택 전에 배정 수준과 반복 구조를 schema로 기록해야 합니다.

다음 토픽으로

다음 편에서는 변수의 자료형, schema, provenance를 정리합니다. 그 뒤 stat-004에서 분석 단위가 정해진 데이터를 중심·산포·분포로 요약합니다.

참고 자료

본 편의 설명, 표, schema, 시나리오는 BioStatPy가 독립적으로 작성한 교육용 구성입니다. 외부 자료의 문장·표현·예제 배열을 재현하지 않습니다.

💬 질문과 댓글

0개의 댓글

로그인 없이 작성할 수 있습니다. 비로그인 댓글은 작성 후 직접 수정·삭제할 수 없습니다.

0/2000

로딩 중...