목록으로

실험단위·관측단위·분석단위는 왜 다를까

바이오 실험의 작은 숫자와 데이터 구조를 이용해 실험단위·관측단위·분석단위는 왜 다를까를 처음부터 단계적으로 배웁니다.

입문
|
25
|
검증 완료 (2026-08-13)
JMP생물통계학바이오 실험기초통계
진행률0/10 (0%)

이 글의 모든 수치와 ID는 교육용 합성 데이터입니다.

01. 오늘 해결할 문제

Control과 Treatment 각각에 culture 4개가 있고, culture마다 well을 3개씩 읽었다고 해봅시다. 파일에는 숫자가 24줄 있습니다. 그렇다면 이 실험의 표본크기는 정말 n=24일까요?

핵심은 숫자가 몇 줄이냐가 아니라, 처리를 서로 독립적으로 받은 대상이 무엇이냐입니다. 이 예제에서는 처리 배정이 culture 수준에서 이루어졌으므로 독립 정보의 기본 단위는 culture입니다. 따라서 총 독립 culture는 8개이고 조건별 분석 n은 4입니다.

02. 초보자의 첫 생각

처음에는 “한 행에 측정값 하나가 있으니 행마다 표본 하나”라고 생각하기 쉽습니다. spreadsheet는 24개 행을 똑같은 모양으로 보여 주기 때문입니다.

하지만 C01이라는 culture가 W01, W02, W03 세 행에 반복됩니다. 세 값은 같은 culture에서 나온 기술반복(technical replicate)입니다. 측정은 세 번 했지만, C01이 세 개의 독립 culture로 늘어난 것은 아닙니다.

03. 직관 만들기

한 culture를 세 번 촬영한 것과 서로 다른 culture 세 개를 한 번씩 촬영한 것은 다릅니다. 첫 상황은 같은 대상에 대한 측정 정보를 더 많이 모은 것이고, 두 번째 상황은 독립 대상을 더 많이 준비한 것입니다.

이 비유에도 한계는 있습니다. 실제 실험에서는 같은 donor, 같은 plate, 같은 day나 batch가 culture들을 다시 묶을 수 있습니다. “culture”라는 이름만 보고 독립성을 자동 판정하지 말고, 실제 준비·배정·측정 구조를 확인해야 합니다.

04. 필요한 용어

용어쉬운 뜻이 예제에서의 대상
실험단위 (experimental unit)처리를 따로 받을 수 있는 가장 작은 대상culture
관측단위 (observation unit)값을 실제로 측정해 한 행으로 기록한 대상technical well
분석단위 (analysis unit)모델에서 독립 정보 한 덩어리로 취급하는 대상culture-level summary
기술반복 (technical replicate)같은 biological material을 반복 측정한 값culture당 3개 well
의사반복 (pseudoreplication)의존된 관측을 독립 표본처럼 세는 오류24개 well을 n=24로 분석

실험단위와 분석단위가 항상 같은 것은 아닙니다. 이 글에서는 구조를 처음 배우기 위해 culture-level 요약을 분석단위로 두지만, 반복측정·계층·donor 효과가 있는 연구는 그 구조를 직접 표현하는 모델이 필요할 수 있습니다.

05. 수학·통계 bridge

먼저 행 수를 계산합니다.

text
n_rows = n_cultures × wells_per_culture
       = 8 × 3
       = 24 observations

다음으로 같은 culture의 세 well을 culture별로 묶습니다.

conditionculturewell 값 (%)culture 평균 (%)
ControlC0196, 97, 9596
ControlC02101, 100, 99100
ControlC0398, 97, 9998
ControlC04103, 102, 104103
TreatmentC05111, 110, 112111
TreatmentC06107, 108, 106107
TreatmentC07114, 113, 115114
TreatmentC08109, 110, 108109

이제 분석에 기여하는 독립 culture-level 값은 조건별 4개입니다.

text
n_analysis,total = 8 cultures
n_analysis,group = 4 cultures per condition

24 observations, 8 cultures, 4 cultures per condition은 모두 맞는 count이지만 서로 다른 단위를 셉니다. 단위를 생략하면 맞는 숫자도 잘못 해석될 수 있습니다.

06. 원자료 기반 바이오 사례

이 교육용 합성 사례의 질문은 “처리 조건에 따라 culture-level viability가 달라지는가?”입니다. Control과 Treatment에 independently prepared culture 4개씩을 배정하고, 각 culture를 technical well 3개로 반복 측정합니다.

  • response: viability_percent (%)
  • factor: condition
  • experimental unit: culture
  • observation unit: technical well
  • introductory analysis unit: culture 평균
  • 결측·제외: v1에는 없음

이 표는 실제 실험 결과가 아닙니다. 내부 원자료의 값·label·layout을 가져오지 않고 학습 목표에 맞게 고정한 clean-room 합성 합성 자료입니다.

07. 데이터 생성 구조

구조를 시간순으로 읽으면 오류를 줄일 수 있습니다.

  1. culture C01–C08을 서로 독립적으로 준비했다고 가정합니다.
  2. Control 또는 Treatment를 culture 수준에서 배정합니다.
  3. 각 culture에서 well 3개를 측정합니다.
  4. 행마다 culture_id를 남겨 어떤 well들이 같은 culture에 속하는지 보존합니다.
  5. 이 입문 예제에서는 culture별 세 값을 요약해 조건별 culture 4개를 비교 준비합니다.

plate 위치나 row order는 독립성의 근거가 아닙니다. 실제 연구에서는 donor·day·plate·batch·timepoint와 무작위화 기록도 함께 보존해야 합니다.

08. 분석 전 Gate

숫자를 검정하기 전에 다음 질문에 답합니다.

  • 처리를 서로 독립적으로 배정받은 대상은 무엇인가?
  • 한 대상에서 여러 행이 생기는 이유는 무엇인가?
  • 같은 donor·plate·day가 여러 대상을 다시 묶고 있지 않은가?
  • 연구 질문과 모델에서 독립 정보로 취급할 단위는 무엇인가?
  • 제외·결측·요약 규칙은 결과를 보기 전에 정했는가?

이 답을 연구노트에 먼저 쓰지 못하면 n도 아직 확정하지 않은 것입니다.

09. JMP 19.1 실행

이 글에서는 해당 없음입니다. experimental unit은 소프트웨어 메뉴가 자동으로 찾아 주는 열이 아니라 실험의 배정 구조에서 결정해야 합니다.

JMP나 다른 프로그램을 열기 전에 row meaning, treatment assignment level, nesting과 독립 단위를 문장으로 기록합니다. 후속 분석 글에서 이 계약을 column role과 model structure로 옮깁니다.

10. 출력 읽기

이 글에서는 통계 검정 output을 만들지 않습니다. 먼저 읽어야 할 출력은 spreadsheet의 행 수가 아니라 다음과 같은 unit map입니다.

text
24 well observations
└── 8 independent cultures
    ├── Control: 4 cultures
    └── Treatment: 4 cultures

11. 틀린 지름길

잘못된 지름길 1: n=24로 두 집단을 비교합니다. 그러면 같은 culture의 세 well을 서로 독립이라고 가정해 불확실성을 실제보다 작게 볼 위험이 있습니다.

잘못된 지름길 2: “모든 technical replicate를 평균내면 언제나 해결”이라고 말합니다. 이 합성 자료에서는 culture 평균이 교육적으로 적절하지만, 같은 donor에서 여러 culture가 나오거나 timepoint가 반복되면 의존 구조가 여전히 남습니다.

수정된 판단은 “행을 줄여라”가 아니라 배정·계층·질문에 맞는 분석단위를 정하고 그 근거를 보고하라입니다.

12. 보고·한계

연구노트 문장 예시는 다음과 같습니다.

Treatment was assigned independently to cultures. Three technical-well observations were recorded per culture, and the culture-level summary was used as the introductory analysis unit.

보고서 문장 예시는 다음과 같습니다.

각 조건에는 독립 culture 4개가 포함되었으며, culture당 technical well 3개는 독립 biological replicate로 세지 않았다.

이 문장은 unit과 count를 분명히 하지만 donor·batch effect, 측정오차, 편향 또는 모델 가정을 자동으로 해결하지 않습니다. ARRIVE의 experimental-unit 설명은 animal research reporting guideline에서 온 방법론적 근거이며, 여기서는 cell-culture 규제 의무가 아니라 unit 사고법으로 제한해 사용합니다.

연습문제

EX-01 — 세 unit 찾기

Control과 Treatment에 culture 4개씩 있고, culture마다 technical well 3개를 측정했다. treatment는 culture 수준에서 독립 배정되며 이 입문 분석은 culture별 평균을 사용한다.

  1. experimental unit은 무엇인가?
  2. observation unit은 무엇인가?
  3. analysis unit은 무엇인가?
  4. 총 관측 수와 조건별 분석 n을 단위와 함께 쓰라.

EX-02 — 의사반복 교정

한 분석자가 “조건마다 well이 12개이므로 n=12/group”이라고 적었다.

  1. 어떤 ID를 확인해야 이 주장의 문제를 발견할 수 있는가?
  2. 이 주장이 무시한 의존 구조를 한 문장으로 설명하라.
  3. 수정된 조건별 n을 단위와 함께 쓰라.

EX-03 — 보고 문장

다음 문장을 unit-aware 문장으로 고쳐라.

반드시 포함할 요소:

  • 독립 treatment-assignment unit
  • 조건별 독립 unit 수
  • unit당 technical observation 수
  • technical well을 독립 biological replicate로 세지 않았다는 설명

정답 및 해설

EX-01 정답

  1. treatment가 독립적으로 배정된 대상은 culture이므로 experimental unit은 culture다.
  2. 실제 한 행의 값을 읽은 대상은 technical well이므로 observation unit은 well이다.
  3. 이 입문 분석이 culture별 평균을 독립 정보로 사용하므로 analysis unit은 culture-level summary다.
  4. 총 관측 수는 24 well observations, 총 독립 culture는 8 cultures, 조건별 분석 n=4 cultures다.

대표 오답은 세 unit을 모두 well이라고 쓰는 것이다. spreadsheet 행과 treatment-assignment independence를 혼동한 답이다.

EX-02 정답

  1. culture_id가 각 조건에서 세 행씩 반복되는지 확인한다.
  2. 같은 culture의 W01–W03은 technical observations로 서로 같은 biological material에 중첩돼 있으며 새 독립 culture가 아니다.
  3. 수정된 값은 n=4 independent cultures per condition이다.

n=12/group은 측정 횟수는 맞지만 독립 분석단위의 count로는 틀리다.

EX-03 정답

가능한 정답:

핵심은 “24 samples”라는 모호한 말을 culture와 well count로 분리하는 것이다. 이 문장만으로 donor·batch dependence가 없다고 보장되지는 않으므로 실제 보고에는 그 구조도 추가한다.

핵심 정리와 다음 강의

이 강의의 계산은 합성 자료를 이해하기 위한 것이다. 계산값이 어느 대상과 단위에서 나왔는지 밝히고, 한 개의 요약값이 말할 수 없는 범위를 함께 기록해야 한다. 다음 강의에서는 이 구분을 한 단계 더 확장한다.

💬 질문과 댓글

0개의 댓글

로그인 없이 작성할 수 있습니다. 비로그인 댓글은 작성 후 직접 수정·삭제할 수 없습니다.

0/2000

로딩 중...