목록으로

차이와 퍼짐을 함께 봐야 하는 이유

두 집단의 평균차이와 집단 내부의 퍼짐을 작은 세포 생존율 자료로 계산하고 함께 해석합니다.

입문
|
25
|
검증 완료 (2026-08-13)
평균차이퍼짐범위표준편차JMP생물통계학
진행률0/10 (0%)

01. 이번 강의에서 답할 질문

Control의 평균 viability가 100%이고 Treatment의 평균이 105%라면 처리 효과는 분명하다고 말할 수 있을까? 평균만 보면 두 조건은 5 percentage points 차이가 난다. 하지만 각 조건의 값들이 평균 주변에 얼마나 모여 있는지에 따라 두 자료의 모습은 전혀 달라질 수 있다.

이 강의의 목표는 두 가지다. 첫째, 집단 사이의 평균차이를 올바른 방향과 단위로 계산한다. 둘째, 각 집단 안의 퍼짐을 함께 살펴 평균 하나로 가려지는 정보를 찾는다. 아직 통계 검정은 하지 않는다.

02. 평균이 같아도 데이터는 다를 수 있다

다음 두 묶음은 평균이 모두 100%다.

자료관측값 (%)평균 (%)범위 (%p)
A99, 100, 100, 1011002
B85, 95, 105, 11510030

A는 값들이 100 주변에 모여 있다. B는 같은 평균을 가지지만 최솟값과 최댓값이 멀리 떨어져 있다. “평균이 100%였다”라는 문장만으로는 이 차이를 알 수 없다.

반대로 퍼짐이 비슷해도 중심이 다를 수 있다. Control이 98, 99, 100, 101이고 Treatment가 103, 104, 105, 106이라면 두 집단은 비슷한 폭으로 퍼져 있지만 Treatment가 전체적으로 오른쪽에 있다.

03. 중심과 퍼짐은 서로 다른 질문이다

평균은 값들의 중심 위치를 요약한다. 퍼짐은 개별값들이 그 중심 주변에서 얼마나 흩어져 있는지 설명한다.

  • 중심에 대한 질문: “Treatment의 평균 viability는 Control보다 얼마나 높은가?”
  • 퍼짐에 대한 질문: “같은 조건의 culture 값들은 서로 얼마나 다른가?”

한 질문의 답이 다른 질문의 답을 대신하지 않는다. 평균차이가 0이어도 퍼짐은 다를 수 있고, 평균차이가 있어도 두 집단의 관측값이 많이 겹칠 수 있다.

04. 필요한 용어를 실제 뜻으로 이해하기

  • 집단 평균(group mean): 한 조건에 속한 관측값을 모두 더해 그 조건의 독립 관측 수로 나눈 값이다.
  • 평균차이(mean difference): 두 집단 평균을 정한 방향으로 뺀 값이다. Treatment − Control인지 반대인지 반드시 적는다.
  • 편차(deviation): 개별 관측값과 그 집단 평균 사이의 차이다. 평균보다 작으면 음수, 크면 양수다.
  • 퍼짐(spread): 관측값들이 중심 주변에 흩어진 정도를 가리키는 일반적인 말이다.
  • 범위(range): 최댓값에서 최솟값을 뺀 값이다. 계산은 쉽지만 두 값만 사용하므로 극단값에 민감하다.
  • 표준편차(standard deviation, SD): 모든 관측값이 평균에서 떨어진 거리를 제곱해 요약한 퍼짐 지표다. 정확한 계산은 뒤 강의에서 더 자세히 다룬다.
  • 겹침(overlap): 서로 다른 집단의 개별 관측값들이 같은 값 영역에 함께 놓이는 현상이다.

05. 작은 숫자로 평균차이를 계산하기

독립 culture 네 개씩을 측정했다고 하자.

conditionculture-level viability (%)
Control96, 98, 100, 102
Treatment101, 103, 105, 107

Control 평균은 다음과 같다.

(96 + 98 + 100 + 102) / 4 = 396 / 4 = 99%

Treatment 평균은 다음과 같다.

(101 + 103 + 105 + 107) / 4 = 416 / 4 = 104%

비교 방향을 Treatment − Control로 정하면 평균차이는 다음과 같다.

104% − 99% = 5 percentage points

여기서 5%라고 쓰면 상대 증가율과 혼동된다. 두 백분율 값을 뺀 절대 차이이므로 5 percentage points, 즉 5%p라고 쓴다.

06. 같은 자료의 퍼짐 계산하기

Control의 범위는 다음과 같다.

102% − 96% = 6%p

Treatment의 범위도 다음과 같다.

107% − 101% = 6%p

두 조건은 이 예에서 평균이 5%p 다르고 범위는 각각 6%p다. 이것은 Treatment 값들이 Control보다 전체적으로 높다는 관찰과, 두 조건 안의 최댓값–최솟값 폭이 같다는 사실을 알려 준다.

그러나 범위가 같다고 분포 모양이나 표준편차까지 같다는 뜻은 아니다. 범위는 가운데 값들을 사용하지 않는다. 96, 98, 100, 10296, 96, 102, 102는 범위가 모두 6%p지만 가운데가 채워지는 방식은 다르다.

07. 평균차이만 보면 생기는 오해

다음 두 실험은 평균차이가 모두 5%p다.

실험Control (%)Treatment (%)평균차이
198, 99, 100, 101103, 104, 105, 1065%p
280, 95, 105, 11685, 100, 110, 1215%p

실험 1은 두 집단 안의 값들이 비교적 모여 있다. 실험 2는 관측값이 넓게 퍼져 있고 두 집단이 많이 겹친다. 평균차이라는 한 숫자는 같지만 데이터가 제공하는 확실성과 재현 가능성에 관한 인상은 같지 않다.

그렇다고 눈으로 겹침만 보고 차이가 없다고 결론내려서도 안 된다. 표본 수, 독립성, 분포, 연구설계와 불확실성을 정식으로 평가하기 전에는 기술적인 관찰 수준으로 표현해야 한다.

08. 바이오 데이터 표를 어떻게 만들어야 할까

이 계산이 의미 있으려면 한 값이 무엇을 대표하는지 분명해야 한다.

의미예시
culture_id독립적으로 준비한 cultureC01
condition배정된 조건Control
viability_percentculture 수준의 반응98.0
unit반응의 단위percent
batch실험 batchB01

같은 culture의 technical well 세 개를 독립값 세 개로 넣으면 퍼짐과 표본 수가 왜곡된다. well 수준 원자료를 보존하되, 이 기초 예에서는 사전에 정한 방식으로 culture 수준 값을 만든 뒤 culture를 독립 단위로 비교한다.

09. JMP에서는 어디로 연결될까

이 강의는 계산 원리를 먼저 배우는 개념편이므로 JMP에서 검정을 실행하지 않는다. 다만 이후 JMP에서 Analyze > Distribution을 열면 각 조건의 개별값, 평균과 퍼짐을 확인하게 된다. 두 조건 비교에서는 Analyze > Fit Y by X의 Oneway 화면에서 개별 점과 집단 요약을 함께 읽는다.

중요한 순서는 메뉴가 아니라 다음과 같다.

  1. viability_percent가 Continuous인지 확인한다.
  2. condition이 Nominal인지 확인한다.
  3. 개별 culture 점을 먼저 본다.
  4. 집단 평균과 퍼짐을 본다.
  5. 그다음 평균차이와 불확실성, 검정 결과를 읽는다.

10. 결과를 문장으로 읽는 법

좋은 기술 문장은 중심, 퍼짐, 단위와 분석단위를 함께 밝힌다.

합성 자료에서 독립 culture 네 개의 평균 viability는 Control 99%, Treatment 104%였으며, Treatment−Control 평균차이는 5%p였다. 두 조건의 관측 범위는 각각 6%p였다.

이 문장은 실제 처리 효과, 인과성, 통계적 유의성 또는 재현성을 주장하지 않는다. 지금 계산한 것은 작은 합성 자료의 기술통계이기 때문이다.

11. 자주 생기는 실패

평균만 보고 원자료를 숨기기

평균이 같아도 퍼짐과 모양은 다를 수 있다. 개별값이나 적절한 그래프를 함께 제시한다.

범위를 변동의 원인으로 해석하기

범위는 값의 폭을 보여 줄 뿐, 그 폭이 biological variation, batch, 측정오차 중 어디에서 왔는지 알려 주지 않는다.

표준편차와 표준오차를 같은 말로 쓰기

표준편차는 관측값의 퍼짐을, 표준오차는 평균 같은 추정량의 표본 간 흔들림을 설명한다. 둘은 뒤 강의에서 분리해 배운다.

많이 겹치면 차이가 없다고 단정하기

눈에 보이는 겹침은 중요한 관찰이지만 정식 추론의 결론은 아니다. 독립 n과 분석 방법을 함께 봐야 한다.

연습문제

  1. Control 값이 97, 99, 101, 103, Treatment 값이 100, 102, 104, 106일 때 각 평균과 Treatment−Control 평균차이를 구하시오.
  2. 두 집단의 범위를 각각 계산하고 단위를 쓰시오.
  3. 자료 C=90, 100, 100, 110과 D=95, 95, 105, 105의 평균과 범위를 비교하시오. 평균만 보고 두 자료가 같다고 말할 수 있는지 설명하시오.
  4. technical well 3개씩을 가진 culture 4개가 있을 때 독립 n과 관측행 수를 구분해 쓰시오.

정답 및 해설

문제 1

Control 평균은 (97+99+101+103)/4 = 100%다. Treatment 평균은 (100+102+104+106)/4 = 103%다. 따라서 Treatment−Control = 103−100 = 3%p다.

문제 2

Control 범위는 103−97=6%p, Treatment 범위는 106−100=6%p다. 관측값은 %이고 두 % 값의 차이는 %p다.

문제 3

C와 D의 평균은 모두 100%다. C의 범위는 110−90=20%p, D의 범위는 105−95=10%p다. 평균은 같지만 C가 더 넓게 퍼져 있으므로 두 자료가 같다고 말할 수 없다. 범위만으로 분포 전체가 같거나 다르다고 확정하는 것도 피해야 한다.

문제 4

독립적으로 준비된 대상은 culture 4개이므로 biological n은 4다. technical well 관측행은 4×3=12개다. 12개 행을 독립 n=12로 세면 의사반복이 된다.

핵심 정리와 다음 강의

  • 평균차이는 집단 중심의 이동을 보여 준다.
  • 퍼짐은 같은 집단 안의 관측값들이 얼마나 다른지 보여 준다.
  • 평균차이와 퍼짐은 서로 다른 정보이므로 반드시 함께 읽는다.
  • 범위는 쉬운 시작점이지만 최솟값과 최댓값만 사용한다.
  • JMP에서도 개별값을 먼저 보고 평균·퍼짐·불확실성 순서로 읽는다.

다음 강의에서는 불확실성을 확률의 언어로 표현하는 방법으로 넘어간다.

💬 질문과 댓글

0개의 댓글

로그인 없이 작성할 수 있습니다. 비로그인 댓글은 작성 후 직접 수정·삭제할 수 없습니다.

0/2000

로딩 중...