목록으로

평균은 무엇을 대표하는가

바이오 실험의 작은 숫자와 데이터 구조를 이용해 평균은 무엇을 대표하는가를 처음부터 단계적으로 배웁니다.

입문
|
25
|
검증 완료 (2026-08-13)
JMP생물통계학바이오 실험기초통계
진행률0/10 (0%)

01. 오늘 해결할 문제

실험실에서 세포 생존율(Cell Viability)을 측정하여 4개 웰(well)에서 각각 96%96\%, 97%97\%, 95%95\%, 101%101\%라는 결과를 얻었다고 가정해 봅시다. 이 4개의 숫자를 하나로 요약하기 위해 우리는 흔히 다 더한 뒤 4로 나누어 **97.25%97.25\%**라는 대표값을 구합니다. 이 값이 바로 **산술평균(Arithmetic Mean)**입니다.

그그렇다면 이 97.25%97.25\%라는 하나의 숫자는 정확히 무엇을 대표할까요?

  • "모든 웰의 세포가 약 97.25%97.25\%씩 살아있다"고 말해도 될까요?
  • 왜 4개의 서로 다른 숫자를 굳이 하나의 숫자로 줄여야 할까요?
  • 이 하나의 수치가 보여주는 정보는 무엇이고, 반대로 숨기는 위험은 무엇일까요?

오늘 글에서는 산술평균이 데이터의 '중심'을 요약하는 수학적 원리와 대표성의 한계, 그리고 평균을 해석할 때 빠지기 쉬운 함정을 알아봅니다.


02. 초보자의 첫 생각

통계를 처음 접할 때 평균에 대해 가장 흔하게 하는 생각은 다음과 같습니다.

초보자의 생각 1: "평균이 97.25%97.25\%로 나왔으니, 내가 배양한 모든 세포 웰의 상태는 97.25%97.25\%에 해당한다."

이것은 평균을 개별 관측값의 복사본으로 착각하는 오류입니다. 평균은 개별 웰의 실제 값이 아니라, 집단 전체의 위치를 요약한 대표값일 뿐입니다. 실제 웰 중 어느 하나도 정확히 97.25%97.25\%인 것은 없었습니다.

초보자의 생각 2: "평균을 구하려면 데이터가 정규분포(Normal Distribution)를 따라야만 한다."

이 역시 흔한 오해입니다. 산술평균은 데이터의 분포 모양이나 정규성 여부와 상관없이, 덧셈과 나눗셈이 가능한 숫자 데이터라면 언제나 수학적으로 계산할 수 있습니다. 다만, 평균이 그 집단을 얼마나 잘 대표하느냐의 문제는 데이터의 분포 형태와 극단값(Outlier)의 존재 여부에 따라 달라집니다.


03. 직관 만들기

평균의 수학적 본질은 바로 **물리적 시소의 받침대(Balance Point)**입니다.

숫자 직선(Number Line) 상에 우리가 얻은 4개의 측정값인 9595, 9696, 9797, 101101 지점에 같은 무게의 추를 놓았다고 상상해 봅시다. 이 시소가 어느 한쪽으로도 기울어지지 않고 완벽하게 평형을 이루는 받침대의 위치는 정확히 97.2597.25 지점입니다.

text
95    96    97          101
--------●-----●-----●-----------●--------
                     ▲ (97.25: 균형점)

이 받침대의 성질 때문에 평균에서 각 데이터까지의 거리를 계산하면 흥미로운 결과가 나타납니다.

  • 9697.25=1.2596 - 97.25 = -1.25
  • 9797.25=0.2597 - 97.25 = -0.25
  • 9597.25=2.2595 - 97.25 = -2.25
  • 10197.25=+3.75101 - 97.25 = +3.75

이 거리들을 모두 더하면 (1.25)+(0.25)+(2.25)+(+3.75)=0(-1.25) + (-0.25) + (-2.25) + (+3.75) = 0이 됩니다. 즉, 평균을 기준으로 왼쪽으로 떨어진 거리의 합과 오른쪽으로 떨어진 거리의 합은 정확히 일치하여 총합이 0이 됩니다.


04. 필요한 용어

  • 산술평균 (Arithmetic Mean, xˉ\bar{x}): 모든 관측값의 합을 전체 관측값의 개수로 나눈 값으로, 데이터 분포의 수학적 중심(무게중심)을 나타냅니다.
  • 편차 (Deviation, xixˉx_i - \bar{x}): 개별 관측값에서 평균을 뺀 값입니다. 관측값이 평균보다 크면 양수, 작으면 음수가 됩니다. 모든 편차의 합은 항상 0입니다.
  • 대표값 (Representative Value): 데이터 집합 전체의 특징이나 위치를 하나의 수치로 대표하여 나타낸 값입니다.
  • 중심 경향성 (Central Tendency): 관측값들이 어디를 중심으로 모여 있는지를 나타내는 통계적 특성입니다.
  • 단위 (Unit): 측정된 수치가 가지는 물리적·생물학적 의미의 기준(예: %\%, mg/mL\text{mg/mL})입니다. 산술평균은 원자료와 정확히 동일한 단위를 가집니다.

05. 수학·통계 bridge

산술평균은 다음과 같은 수식으로 정의됩니다.

xˉ=1ni=1nxi\bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i

여기서 nn은 관측값의 개수, xix_iii번째 관측값, xˉ\bar{x}(엑스 바)는 표본 산술평균을 의미합니다.

산술평균의 4가지 핵심 수학적 성질

  1. 편차의 합은 항상 0이다: i=1n(xixˉ)=0\sum_{i=1}^{n} (x_i - \bar{x}) = 0 증명: (xixˉ)=xixˉ=nxˉnxˉ=0\sum (x_i - \bar{x}) = \sum x_i - \sum \bar{x} = n\bar{x} - n\bar{x} = 0.

  2. 단위의 보존성: 원자료 xix_i의 단위가 %\%이면, 평균 xˉ\bar{x}의 단위도 %\%입니다. 단위가 변하지 않습니다.

  3. 선형 변환의 가목성: 모든 관측값에 상수 aa를 곱하고 bb를 더한 새로운 변수 yi=axi+by_i = a x_i + b의 평균 yˉ\bar{y}yˉ=axˉ+b\bar{y} = a \bar{x} + b가 됩니다.

  4. 극단값에 대한 민감성 (Sensitivity to Extremes): 단 하나의 값이 매우 크거나 작아지면, 전체 시소의 균형을 맞추기 위해 평균은 그 극단값 방향으로 크게 이동합니다.


06. 원자료 기반 바이오 사례

합성 세포 생존율(Synthetic Cell Viability) 데이터셋을 통해 직접 평균을 계산해 봅시다. 6-well 플레이트의 4개 웰에서 다음 데이터를 얻었습니다.

웰 번호 (Well)측정 항목세포 생존율 (xix_i)
Well 1Viability96%96\%
Well 2Viability97%97\%
Well 3Viability95%95\%
Well 4Viability101%101\%

단계별 계산

  1. 총합 계산: Sum=96%+97%+95%+101%=389%\text{Sum} = 96\% + 97\% + 95\% + 101\% = 389\%
  2. 관측값 개수로 나누기: n=4n = 4 xˉ=389%4=97.25%\bar{x} = \frac{389\%}{4} = 97.25\%

참고: 생존율이 101%101\%로 측정되는 이유는 대조군(Control) 대비 상대 정량 분석 과정에서 발생하는 흡광도 측정 오차 또는 분석 장비의 미세한 파장 변동 때문입니다. 이는 실제 실험에서 흔히 관측되는 정상적인 측정 변동 범위에 속합니다.


07. 데이터 생성 구조

이 사례에서 데이터가 수집되고 테이블로 구성되는 구조는 다음과 같습니다.

text
[실험 단위: 6-well Plate 1개]
   ├── [관측/분석 단위: 개별 Well 4개]
   │      ├── Well 1 ──> 96%
   │      ├── Well 2 ──> 97%
   │      ├── Well 3 ──> 95%
   │      └── Well 4 ──> 101%
   └── [집계 통계량: 산술평균 97.25%]
  • 관측 단위 (Observation Unit): 개별 웰(Well)
  • 측정 변수 (Variable): 세포 생존율 (Cell Viability, 연속형 수치)
  • 요약 통계량 (Summary Statistic): 4개 웰 생존율의 산술평균 (97.25%97.25\%)

개별 웰 4개의 데이터는 개별 관측값 행(row)을 이루며, 평균 97.25%97.25\%는 이 행들을 하나로 요약한 단 하나의 대표수치입니다.


08. 분석 전 Gate

평균을 계산하고 보고하기 전, 다음 4가지 핵심 질문(Gate)을 점검해야 합니다.

  1. Gate 1: 단위가 동일한가? 모든 관측값이 동일한 단위(%\%)로 측정되었는지 확인합니다. 단위가 다르면 덧셈이 불가능합니다.
  2. Gate 2: 표본 수(nn)가 명시되었는가? 평균 97.25%97.25\%n=4n=4에서 나왔는지, n=400n=400에서 나왔는지에 따라 신뢰성이 다릅니다.
  3. Gate 3: 정규분포를 따라야만 평균을 쓸 수 있는가? 아닙니다. 산술평균은 분포의 형태와 무관하게 항상 산술적으로 존재합니다. 정규성이 없다고 해서 평균을 구하지 못하는 것은 아닙니다.
  4. Gate 4: 극단적인 치우침이 있는가? 극단값이 존재하는 경우 평균이 중심에서 멀어질 수 있으므로 산포와 함께 확인해야 합니다.

09. JMP 19.1 실행

이 글에서는 해당 없음 (CONCEPT_ONLY)

본 글(A009)은 통계학의 가장 기초가 되는 '산술평균'의 수학적 개념과 대표성의 의미를 다루는 단원입니다. JMP 19.1 데이터 테이블 구성 및 메뉴 실행(Distribution 플랫폼 등)은 기초 수학/직관 정립 이후인 A014 단원 및 P01 파트부터 다루므로, 본 글에서는 JMP 소프트웨어 실행 과정을 진행하지 않습니다.


10. 출력 읽기

이 글에서는 해당 없음 (CONCEPT_ONLY)

JMP를 포함한 통계 소프트웨어에서 분석을 실행하면 Mean, Std Dev, Std Err Mean 등의 통계량이 출력창에 표시됩니다. 본 단원에서는 이러한 소프트웨어 출력 결과 중 **Mean (산술평균 = 97.25%97.25\%)**의 의미가 '편차의 합이 0이 되는 무게중심'임을 이해하는 것에 집중합니다.


11. 틀린 지름길

평균을 다룰 때 초보자가 빠지기 쉬운 3가지 대표적인 '틀린 지름길(Shortcut Traps)'입니다.

  1. 함정 1: 평균을 개별 관측값으로 착각하기

    • 오류: "평균이 97.25%97.25\%이므로 모든 웰의 생존율이 97.25%97.25\%이다."
    • 교정: 평균은 집단의 위치를 요약한 값일 뿐, 개별 웰의 생존율은 95%95\%부터 101%101\%까지 다양했습니다.
  2. 함정 2: 평균만 보고 두 데이터 집합이 같다고 단정하기

    • 오류: 집단 A(96,97,95,10196, 97, 95, 101)와 집단 B(70,95,110,11470, 95, 110, 114)는 모두 평균이 97.25%97.25\%이므로 두 집단은 동일하다.
    • 교정: 평균은 같지만 집단 A는 좁게 모여 있고, 집단 B는 넓게 퍼져 있습니다. 평균 하나만으로는 데이터의 **산포(Spread)**를 알 수 없습니다.
  3. 함정 3: 소규모 표본 평균으로 배치의 품질이나 규제 적합성을 과장하기

    • 오류: "4개 웰 평균이 97.25%97.25\%이므로 우리 회사의 이번 배치는 완벽하며 승인 기준을 통과했다."
    • 교정: 이는 과장된 진술입니다. 합성 표본 n=4n=4의 산술평균은 당해 측정의 요약일 뿐, 전체 생산 배치나 임상적 효능, 규제 통과를 보장할 수 없습니다.

12. 보고·한계

올바른 보고 문장 예시

"합성 세포 생존율 실험 4개 웰(n=4n=4)의 측정값은 96%96\%, 97%97\%, 95%95\%, 101%101\%이며, 이들의 산술평균은 **97.25%97.25\%**였다."

평균이 가지는 본질적 한계

  1. 퍼짐(산포) 정보의 부재: 데이터가 중심 주변에 얼마나 밀집해 있는지, 혹은 널리 퍼져 있는지 알려주지 못합니다. (이는 다음 글 A010에서 다룰 표준편차/산포 개념이 필요한 이유입니다.)
  2. 극단값 민감성: 극단적인 고농도/저농도 측정값이 1개만 섞여도 평균 전체가 그쪽으로 끌려갑니다.
  3. 대표성 한계: 비대칭이 심한 데이터에서는 평균이 데이터가 가장 많이 모여 있는 지점과 다를 수 있습니다.

연습문제

  • Article ID: BJS-P00-A009
  • Part ID: P00
  • 대상 독자: 바이오 통계 초보자
  • 정답 파일: BJS-P00-A009-what-the-mean-represents-ANSWER-v02.md

안내 사항

본 실습은 본문에서 다룬 산술평균의 정의, 단위, 편차의 성질, 대표성의 한계를 직접 풀면서 확인하도록 구성되었습니다. 풀이를 마친 후 정답 및 해설 파일을 확인해 보세요.

문제 1. 산술평균과 단위 계산

실험실에서 6-well 플레이트의 4개 웰에 대해 세포 생존율(Cell Viability)을 측정한 결과 다음과 같은 수치를 얻었습니다.

Well 1: 96%,Well 2: 97%,Well 3: 95%,Well 4: 101%\text{Well 1: } 96\%, \quad \text{Well 2: } 97\%, \quad \text{Well 3: } 95\%, \quad \text{Well 4: } 101\%

  1. 이 4개 측정값의 산술평균을 계산하는 전체 과정을 쓰시오.
  2. 구한 산술평균 수치 뒤에 붙어야 하는 올바른 단위는 무엇인지 명시하시오.

문제 2. 편차(Deviation)의 합 검증

문제 1에서 구한 산술평균 xˉ=97.25%\bar{x} = 97.25\%를 이용하여 다음 질문에 답하시오.

  1. 각 웰(xix_i)의 측정값에 대한 편차(xixˉx_i - \bar{x}) 4개를 각각 구하시오.
  2. 구한 편차 4개를 모두 더했을 때 총합이 얼마가 되는지 계산하고, 이것이 평균의 어떤 물리적/수학적 성질을 나타내는지 간단히 서술하시오.

문제 3. 동일한 평균, 서로 다른 분포

두 연구팀 A와 B가 각각 4개의 웰에서 세포 생존율을 측정하였습니다.

  • 연구팀 A의 관측값: 96%,97%,95%,101%96\%, 97\%, 95\%, 101\% (평균: 97.25%97.25\%)
  • 연구팀 B의 관측값: 70%,95%,110%,114%70\%, 95\%, 110\%, 114\% (평균: 97.25%97.25\%)

두 연구팀의 산술평균은 97.25%97.25\%로 완전히 같습니다. "평균이 같으므로 두 연구팀의 실험 데이터 특성은 완전히 동일하다"라는 주장에 대해 동의 여부와 그 이유를 설명하시오.

문제 4. 대표성 해석의 오류 찾기

어떤 연구원이 보고서에 다음과 같이 적었습니다.

이 보고서 문장에서 통계적으로 잘못되거나 과장된 표현 2가지를 찾아 지적하시오.

정답 및 해설

  • Article ID: BJS-P00-A009
  • Part ID: P00
  • 대상 독자: 바이오 통계 초보자
  • 관련 실습 파일: BJS-P00-A009-what-the-mean-represents-PRACTICE-v02.md

문제 1 해설 및 정답

문제 요약

합성 세포 생존율 측정값 4개(96%96\%, 97%97\%, 95%95\%, 101%101\%)의 산술평균과 그 단위를 구하시오.

풀이 과정

  1. 모든 관측값의 합 구하기: 합계=96%+97%+95%+101%=389%\text{합계} = 96\% + 97\% + 95\% + 101\% = 389\%
  2. 관측값 개수(nn)로 나누기: xˉ=389%4=97.25%\bar{x} = \frac{389\%}{4} = 97.25\%

최종 정답

  • 산술평균: 97.25%97.25\%
  • 단위: %\% (원자료의 단위와 동일)

대표적 오답 및 오답 이유

  • 대표 오답: 97.25 (단위 누락)
  • 오답 이유: 통계량은 수치와 단위가 결합된 물리적/생물학적 의미를 가집니다. 단위 없이 숫자만 표기하면 비율, 절대 세포 수, 배율 등 다른 측정 지표와 혼동을 유발할 수 있습니다.

문제 2 해설 및 정답

문제 요약

평균 xˉ=97.25%\bar{x} = 97.25\%에 대한 4개 관측값의 편차(xixˉx_i - \bar{x})를 각각 구하고, 편차의 총합이 00임을 증명하시오.

풀이 과정

  1. 각 관측값별 편차 계산:
    • x1=96%    d1=9697.25=1.25%x_1 = 96\% \implies d_1 = 96 - 97.25 = -1.25\%
    • x2=97%    d2=9797.25=0.25%x_2 = 97\% \implies d_2 = 97 - 97.25 = -0.25\%
    • x3=95%    d3=9597.25=2.25%x_3 = 95\% \implies d_3 = 95 - 97.25 = -2.25\%
    • x4=101%    d4=10197.25=+3.75%x_4 = 101\% \implies d_4 = 101 - 97.25 = +3.75\%
  2. 편차의 총합 계산: i=14(xixˉ)=(1.25)+(0.25)+(2.25)+(+3.75)=3.75+3.75=0.00%\sum_{i=1}^{4} (x_i - \bar{x}) = (-1.25) + (-0.25) + (-2.25) + (+3.75) = -3.75 + 3.75 = 0.00\%

최종 정답

  • 각 편차: 1.25%-1.25\%, 0.25%-0.25\%, 2.25%-2.25\%, +3.75%+3.75\%
  • 편차의 합: 0.00%0.00\%

대표적 오답 및 오답 이유

  • 대표 오답: 편차의 합을 계산할 때 부호를 무시하고 절대값을 더해 7.5%7.5\%라고 작성하는 경우.
  • 오답 이유: 편차(deviation)는 방향성을 가지는 1차 차이값입니다. 부호를 제거한 값의 합은 절댓값 편차의 합으로, 산술평균이 지닌 '수학적 무게중심(Balance Point)' 성질을 보여주지 못합니다. 산술평균은 음의 편차 합과 양의 편차 합이 정확히 상쇄되어 균형을 이루는 지점입니다.

문제 3 해설 및 정답

문제 요약

조건 A(96%, 97%, 95%, 101%)와 조건 B(70%, 95%, 110%, 114%)는 모두 평균이 97.25%입니다. 평균이 같다는 이유만으로 두 실험 결과가 완전히 동일하다고 결론지을 수 없는 이유를 설명하시오.

풀이 과정

  1. 평균의 대표성 범위 확인: 산술평균은 모든 데이터 위치의 '중심'만을 나타냅니다.
  2. 산포(퍼짐성)의 차이 비교:
    • 조건 A의 값들은 95%95\%에서 101%101\% 사이(범위 6%6\%)에 밀집되어 있습니다.
    • 조건 B의 값들은 70%70\%에서 114%114\% 사이(범위 44%44\%)에 크게 퍼져 있습니다.
  3. 해석적 한계 서술: 평균 하나만으로는 데이터가 중심 주변에 빽빽하게 모여 있는지, 넓게 산재되어 있는지(변동성) 알 수 없습니다.

최종 정답

산술평균은 데이터의 중심 위치 하나만을 요약하는 지표입니다. 조건 A와 조건 B처럼 평균이 97.25%97.25\%로 동일하더라도, 개별 관측값이 중심 주변에 모인 정도(산포 또는 변동성)는 완전히 다를 수 있습니다. 따라서 평균만으로 두 집단이 동일하다고 결론지어서는 안 되며, 변동성을 함께 확인해야 합니다.

대표적 오답 및 오답 이유

  • 대표 오답: "조건 B에는 70%라는 낮은 값이 있으므로 산술평균 계산이 불가능하거나 정규분포가 아니어서 평균을 쓰면 안 된다."
  • 오답 이유: 산술평균은 데이터의 분포 모양이나 정규분포 여부와 상관없이 모든 덧셈 가능한 수치 데이터에서 항상 계산할 수 있습니다. 정규분포가 아니라고 해서 평균이 존재하지 않는 것은 아니며, 단지 평균이 데이터의 퍼짐 상태까지 전부 대표하지 못할 뿐입니다.

문제 4 해설 및 정답

문제 요약

평균 97.25% 결과를 바탕으로 "우리 회사에서 생산하는 모든 세포 배양 웰의 세포 생존율은 97.25%다"라고 보고서에 썼을 때의 치명적인 문제점을 지적하시오.

풀이 과정

  1. 표본 요약과 전체 추정의 구분: 표본 4개의 산술평균 97.25%97.25\%는 당해 측정된 4개 well의 집계 결과일 뿐, 측정되지 않은 다른 well의 생존율을 보장하지 않습니다.
  2. 개별 개체와 평균의 구분: 평균이 97.25%97.25\%라 하더라도 개별 웰의 실제 측정값은 95%95\% 또는 101%101\%처럼 다릅니다. '모든 웰이 97.25%97.25\%'라는 진술은 오독입니다.
  3. 규제/제품 주장 확장 금지: 소규모 학술/교육용 합성 표본 데이터에서 전체 배치나 제품 품질 규제 적합성을 주장하는 것은 통계적 과장입니다.

최종 정답

이 보고서는 두 가지 심각한 오류를 범하고 있습니다. 첫째, 평균값(97.25%97.25\%)을 개별 관측값(95%,96%,97%,101%95\%, 96\%, 97\%, 101\%) 전체의 실제값인 것처럼 동일시하였습니다. 둘째, 특정 4개 웰 표본의 요약 통계량을 검증되지 않은 전체 모집단이나 미래 배치 생산품 전체의 확정된 성능으로 지나치게 확대 해석(과장 보고)하였습니다.

대표적 오답 및 오답 이유

  • 대표 오답: "평균 계산 과정에서 101%라는 오류값이 들어갔으므로 101%를 지우고 다시 계산해야 한다."
  • 오답 이유: 101%는 측정 오차나 분석 법위 표준화에 의해 발생할 수 있는 합리적인 관측 범위 내의 값입니다. 마음에 들지 않는 숫자를 무단으로 삭제하는 것은 데이터 조작에 해당하며, 평균의 대표성을 논하는 올바른 문제 해결 방식이 아닙니다.

학습 결과 체크리스트

검증 항목합격 기준확인
수치 정확성xˉ=97.25%\bar{x} = 97.25\% 및 편차합 00 도출[x]
단위 표기결과값에 단위 %\% 명시[x]
대표성 한계 이해동일 평균·다른 산포 가능성 설명[x]
오류 진단개별값과 평균의 혼동 및 과장 주장 지적[x]

핵심 정리와 다음 강의

이 강의의 계산은 합성 자료를 이해하기 위한 것이다. 계산값이 어느 대상과 단위에서 나왔는지 밝히고, 한 개의 요약값이 말할 수 없는 범위를 함께 기록해야 한다. 다음 강의에서는 이 구분을 한 단계 더 확장한다.

💬 질문과 댓글

0개의 댓글

로그인 없이 작성할 수 있습니다. 비로그인 댓글은 작성 후 직접 수정·삭제할 수 없습니다.

0/2000

로딩 중...