01. 오늘 해결할 문제
실험실에서 세포 생존율(Cell Viability) 실험을 진행한 후 결과를 요약하는 상황을 생각해 봅시다. 대조군(Control)의 평균 생존율은 였고, 약물을 처리한 처치군(Treatment)의 평균 생존율은 였습니다. 연구원이 보고서에 "약물 처리 후 세포 생존율이 증가했다"고 작성했습니다.
이 문장은 과연 정확한 통계적·생물학적 보고일까요?
만약 동료 연구원이 "생존율이 에서 로 증가한 것은 증가가 아니라 증가"라고 주장한다면 누구의 말이 맞는 것일까요? 더 나아가, 데이터 시트의 '처리 조건' 열에 대조군을 1, 처치군을 2로 입력해 놓았을 때, 이 숫자 1과 2를 더하거나 평균을 내어 1.5라는 결과를 만드는 것이 과학적으로 의미가 있을까요?
우리가 수집하는 데이터는 숫자 형태를 띠고 있더라도 모두 같은 성격을 갖지 않습니다. 변수의 종류(범주형 vs 수치형), 측정 단위( vs ), 그리고 측정의 정밀도에 따라 우리가 계산할 수 있는 통계량과 물어볼 수 있는 질문 자체가 완전히 달라집니다. 오늘 글에서는 데이터를 바르게 분류하고 올바른 단위를 부여하는 최소한의 통계적 언어를 구축합니다.
02. 초보자의 첫 생각
통계와 데이터 분석을 처음 접하는 연구자들은 엑셀이나 데이터 테이블에 적힌 값을 볼 때 다음과 같은 몇 가지 대표적인 오해에 빠지기 쉽습니다.
- "숫자로 적혀 있으면 모두 계산 가능한 수치 데이터다." 실험 조건(Control=1, Treatment=2)이나 독성 등급(Grade 1, Grade 2, Grade 3)처럼 숫자로 기재되어 있으면, 프로그램에서 평균이나 표준편차를 바로 계산해도 된다고 생각합니다.
- "범주형(Categorical) 변수는 중요하지 않은 단순 라벨이므로 무시해도 된다." 수치형 변수(예: 생존율, 흡광도)만이 진짜 데이터이고, 그룹 이름이나 범주 정보는 통계 모델링에서 제외해도 되는 보조적인 정보로 치부하는 경향이 있습니다.
- "퍼센트()와 퍼센트 포인트()는 같은 말이므로 섞어 써도 상관없다." 에서 로의 변화를 증가라고 부르든, 증가라고 부르든 듣는 사람이 알아서 이해할 것이라고 지레 짐작합니다.
그러나 이러한 오해는 통계 소프트웨어에 잘못된 명령을 내리게 만들고, 잘못된 수치 요약을 초래하며, 최종적으로 결론을 왜곡하는 원인이 됩니다.
03. 직관 만들기
데이터의 유형과 단위를 이해하기 위해 실생활과 실험실의 직관적인 예시를 들어보겠습니다.
라벨로서의 숫자 vs 양으로서의 숫자
강의실 문에 적힌 '101호'와 '102호'라는 숫자를 더해 '203호'를 만들 수 없듯이, 실험 대조군 코드 1과 처치군 코드 2의 평균인 1.5는 존재하지 않는 제3의 실험 조건을 의미할 뿐 아무런 양적 의미가 없습니다. 데이터 테이블의 숫자가 **이름(Label)**인지 **양(Quantity)**인지를 먼저 구분해야 합니다.
범주형 변수의 스펙트럼
- 이분형 (Binary): 세포의 상태가 '생존(Alive)' 또는 '사멸(Dead)'처럼 딱 두 가지로만 나뉘는 경우입니다.
- 명목형 (Nominal): 약물 종류(Drug A, Drug B, Control)처럼 순서가 없는 범주입니다. Drug A가 Control보다 '크다'고 말할 수 없습니다.
- 순서형 (Ordinal): 암의 병기(Stage I, Stage II, Stage III)나 독성 등급(Low, Medium, High)처럼 분명한 순서가 존재하는 범주입니다. 단, Stage I과 II 사이의 거리와 Stage II와 III 사이의 거리가 같지는 않습니다.
수치형 변수와 단위의 정밀도
- 계수형/이산형 (Count/Discrete): 페트리 디쉬 위의 콜로니 개수(12개, 15개)처럼 낱개로 세어지는 정수 값입니다. 12.4개의 콜로니는 존재하지 않습니다.
- 연속형 (Continuous): 세포 생존율(), 단백질 농도()처럼 소수점 아래 연속적인 수치를 가질 수 있는 측정값입니다.
absolute vs relative: 와 의 결정적 차이
생존율이 로 향상된 경우를 봅시다.
- 절대적 차이 (Absolute Difference): 백분율 값 자체를 뺀 차이입니다.
- 상대적 변화율 (Relative Change): 대조군 기준값 대비 증가한 비율입니다.
증가와 증가는 완전히 다른 수치입니다. 만약 생존율에서 "실제로 상대 증가"했다면, 생존율은 가 되었어야 합니다.
04. 필요한 용어
학술 논문과 통계 분석에서 혼동 없이 사용해야 하는 핵심 용어 정의입니다.
- 범주형 변수 (Categorical Variable): 측정 대상이 속한 그룹이나 범주를 나타내는 변수.
- 명목형 변수 (Nominal Variable): 범주 간에 순서나 우열이 없는 변수 (예: 세포주 명칭, 약물 그룹).
- 순서형 변수 (Ordinal Variable): 범주 간에 명확한 순서가 있으나 간격이 일정하지 않은 변수 (예: 증상 심각도 Grade 1/2/3).
- 이분형 변수 (Binary / Dichotomous Variable): 두 개의 상호 배타적인 범주만 갖는 변수 (예: 음성/양성, 사멸/생존).
- 수치형 변수 (Numerical / Quantitative Variable): 양적인 크기를 나타내며 산술 연산이 가능한 변수.
- 연속형 변수 (Continuous Variable): 특정 구간 내의 모든 실수를 값으로 가질 수 있는 변수 (예: 생존율 , 농도 ).
- 계수형 변수 (Discrete / Count Variable): 셀 수 있는 비음의 정수 값을 갖는 변수 (예: 콜로니 개수, 세포 수).
- 측정 단위 (Unit of Measurement): 수치의 물리적·생물학적 의미를 부여하는 기준 척도 (, , , ).
- 퍼센트 포인트 (Percentage Point, ): 백분율 수치 자체의 산술적 차이를 나타내는 단위.
- 퍼센트 변화율 (Percent Change, ): 기준값에 대한 상대적 변화 비율을 나타내는 단위.
05. 수학·통계 bridge
수학적으로 변수의 척도(Scale of Measurement)에 따라 허용되는 연산자(Operators)가 결정됩니다.
1. 명목형 변수 (Nominal Scale)
- 허용 연산: 등가성 비교 ( 또는 )
- 가능한 통계량: 범주별 빈도수(Count, ), 비율(Proportion, ).
- 불가능한 연산: 덧셈, 뺄셈, 평균 계산.
2. 순서형 변수 (Ordinal Scale)
- 허용 연산: 크기 비교 ( 또는 )
- 가능한 통계량: 중앙값(Median), 백분위수(Percentile), 최빈값(Mode).
- 주의사항: 등급 간 차이 와 가 수학적으로 동일하다고 볼 수 없으므로 표준 산술 평균을 적용할 때 주의해야 합니다.
3. continuous/interval/ratio scale
- 허용 연산: 사칙연산 (, , , )
- 가능한 통계량: 산술 평균(Mean), 표준편차(SD), 변동계수(CV).
- 변화량 계산 공식:
- 절대적 변화량 ():
- 상대적 변화율 ():
06. 원자료 기반 바이오 사례
합성 세포 생존율 6-well 플레이트 실험 데이터를 통해 각 변수의 역할과 단위를 살펴봅시다.
| Well ID | Group (명목형) | Dosage Grade (순서형) | Colony Count (계수형) | Viability Rate (연속형) | Viability Unit |
|---|---|---|---|---|---|
| W01 | Control | Grade 0 (None) | 120 | 80.0 | |
| W02 | Control | Grade 0 (None) | 115 | 79.5 | |
| W03 | Control | Grade 0 (None) | 118 | 80.5 | |
| W04 | Treatment | Grade 2 (Medium) | 45 | 84.5 | |
| W05 | Treatment | Grade 2 (Medium) | 42 | 85.0 | |
| W06 | Treatment | Grade 2 (Medium) | 48 | 85.5 |
- 분석 단위: 개별 Well ()
- Group 간 Viability Rate 비교:
- Control 평균 생존율:
- Treatment 평균 생존율:
- 절대적 생존율 향상:
- 상대적 생존율 향상:
이처럼 한 실험 안에서도 Group은 '비교 대상 범주', Colony Count는 '세포 증식 수치', Viability Rate는 '비율 수치'로서 각기 완전히 다른 통계적 역할을 수행합니다.
07. 데이터 생성 구조
데이터 시트를 구성할 때 열(Column)마다 고유한 변수 유형(Modeling Type)과 측정 단위를 명확히 설정해야 합니다.
08. 분석 전 Gate
통계 분석 소프트웨어나 엑셀에 데이터를 입력하기 전 다음 Check List를 점검해야 합니다.
- Check 1: 데이터 테이블의 각 열이 범주형(Nominal/Ordinal)인지 수치형(Continuous/Count)인지 구분하였는가?
- Check 2: 숫자로 입력된 그룹 코드(예: 1, 2, 3)가 수치 연산 대상이 아니라 명목형 범주임을 인식하였는가?
- Check 3: 수치형 변수에 명확한 측정 단위(, , )가 표기되어 있는가?
- Check 4: 백분율 수치의 변화를 보고할 때 절대 차이()와 상대 변화율() 중 어느 것인지 명확히 구분하였는가?
09. JMP 19.1 실행
이 글에서는 해당 없음 (CONCEPT_ONLY)
사유: 본 BJS-P00-A006 아티클은 통계학의 기초 변수 유형 및 측정 단위 개념을 정립하는 이론 파트입니다. JMP 데이터 테이블에서의 Modeling Type 지정(Nominal, Ordinal, Continuous 설정) 및 컬럼 속성 부여는 P00-A014 및 P01 파트에서 본격적으로 다룹니다.
10. 출력 읽기
이 글에서는 해당 없음 (CONCEPT_ONLY)
사유: 소프트웨어 실행 출력을 해석하는 단계는 JMP 메뉴 실습이 진행되는 아티클에서 제공됩니다.
11. 틀린 지름길
실무에서 자주 저지르는 치명적인 세 가지 실수 패턴입니다.
- 명목형 코드 수치 연산하기 (Coded Category Averaging): Control=1, Treatment A=2, Treatment B=3으로 코딩된 열의 평균을 구하여 "우리 실험군의 평균 그룹 코드는 2.0이다"라고 보고하는 오류.
- 범주형 변수를 분석 모델에서 제거하기 (Ignoring Categorical Factors): 수치형 측정값(생존율)만 중요하게 여기고, 요인 변수(약물 종류, 세포주)를 무시하여 전체 데이터를 하나로 뭉쳐 평균을 내는 오류 (그룹 간 차이가 파묻힘).
- 와 단위 기호 혼용하기 (Unit Confusion): 생존율 에서 로의 증가를 " 증가"라고 표기하는 오류. 이는 상대 증가율 와 절대 차이 모두에 거짓을 말하게 됩니다.
12. 보고·한계
올바른 보고 가이드라인
- 변수 명시: "처리 조건(범주형-명목형)에 따른 세포 생존율(수치형-연속형, 단위: )을 비교하였다."
- 단위 명시: "약물 처리군은 대조군 대비 평균 세포 생존율이 증가하였으며 (대조군 vs 처치군 ), 이는 대조군 대비 의 상대적 생존율 향상에 해당한다."
본 아티클 사례의 한계
- 본 글에서 사용된 세포 생존율 6-well 데이터는 수치 구조와 단위 개념을 설명하기 위해 만든 **교육용 합성 데이터(Synthetic Data)**입니다.
- 실제 임상 시험, 생체 내(in vivo) 실험, 혹은 실제 의약품 품질 관리 배치 주장으로 확장 해석할 수 없습니다.
연습문제
안내
본 실습은 아티클에서 다룬 범주형·수치형 변수의 구분, 측정 단위의 이해, 그리고 퍼센트()와 퍼센트 포인트()의 계산 구분을 확인하는 문제로 구성되어 있습니다. 문제 해결 과정에서 답안을 미리 작성해 본 후, 정답 및 해설 파일과 비교해 보세요.
[문제 1] 변수 유형 식별하기
다음 5가지 바이오 실험 측정 항목(1-1 ~ 1-5)을 보고, 각각이 아래의 5가지 통계적 변수 유형 중 어디에 해당하는지 제시하시오.
1-1. 세포 생존 여부 (Alive / Dead) 1-2. 실험에 사용된 세포주 명칭 (HeLa, HEK293, MCF7) 1-3. 독성 심각도 등급 (Grade 1, Grade 2, Grade 3) 1-4. Well 당 형성된 콜로니 개수 (45개, 52개, 38개) 1-5. 측정된 세포 생존율 (72.4%, 81.1%, 65.8%)
[문제 2] 세포 생존율 변화 분석 (%p vs %)
어떤 신규 화합물을 처리한 연구에서, 대조군(Control)의 평균 세포 생존율은 였고, 약물 처리군(Treatment)의 평균 세포 생존율은 였습니다.
2-1. 대조군 대비 처리군의 세포 생존율 절대적 변화량을 올바른 단위와 함께 계산하시오. 2-2. 대조군 대비 처리군의 세포 생존율 **상대적 변화율(Percent Change)**을 올바른 단위와 함께 계산하시오.
[문제 3] 실무 데이터 오류 진단 및 보고서 수정
연구원 A는 3가지 약물 처리 조건(1=Control, 2=Treatment A, 3=Treatment B)에 대해 각각 10개씩 총 30개 well 데이터를 입력한 뒤, 엑셀에서 그룹 열의 평균을 구하여 다음과 같이 보고서에 작성하였습니다.
이 보고서 문장에 포함된 통계적 오류를 진단하고, 이를 바르게 교정한 올바른 분석 방안을 서술하시오.
정답 및 해설
1. 정답 요약 표
| 문제 번호 | 평가 영역 | 최종 정답 | 핵심 단위 |
|---|---|---|---|
| 문제 1-1 | 변수 유형 식별 | 범주형-이분형 (Binary Categorical) | 범주 범주 (생존/사멸) |
| 문제 1-2 | 변수 유형 식별 | 범주형-명목형 (Nominal Categorical) | 범주 이름 (세포주 명칭) |
| 문제 1-3 | 변수 유형 식별 | 범주형-순서형 (Ordinal Categorical) | 계급 순서 (Grade 1 < 2 < 3) |
| 문제 1-4 | 변수 유형 식별 | 수치형-계수형 (Discrete/Count Numerical) | 개 (cells 또는 colonies) |
| 문제 1-5 | 변수 유형 식별 | 수치형-연속형 (Continuous Numerical) | % (세포 생존율) |
| 문제 2-1 | 절대적 변화량 | +7.0 %p | 퍼센트 포인트 (%p) |
| 문제 2-2 | 상대적 변화율 | +10.0 % | 퍼센트 (%) |
| 문제 3-1 | 오류 진단 및 수정 | 코딩된 그룹 번호(1, 2, 3)의 평균 산출 오류. 명목형 변수는 산술 평균이 불가능하며 빈도수 분석을 수행해야 함. | 빈도수 / 비율 (%) |
2. 상세 단계별 풀이 및 검증
[문제 1] 변수 유형 식별 풀이
1-1. 세포 생존 여부 (Alive / Dead)
- 단계 1 (척도 분석): 측정 가능한 값이 숫자가 아니라 '생존' 또는 '사멸'의 두 가지 상호 배타적인 상태(범주)로 나뉩니다.
- 단계 2 (분류): 2개의 범주만 가지므로 범주형 중에서도 **이분형 변수(Binary / Dichotomous Categorical Variable)**에 해당합니다.
- 대표 오답 및 오류 원인: '1=생존, 0=사멸'로 데이터베이스에 기록된 것을 보고 수치형 변수로 오인하는 경우가 많습니다. 숫자는 단지 기호일 뿐 산술 연산이 불가능하므로 이분형 범주입니다.
1-2. 사용된 세포주 명칭 (HeLa, HEK293, MCF7)
- 단계 1 (척도 분석): 세포주들의 이름이며, 세포주 간에 자연스러운 순서나 우열(HeLa > HEK293 등)이 존재하지 않습니다.
- 단계 2 (분류): 순서가 없는 범주이므로 **범주형-명목형 변수(Nominal Categorical Variable)**입니다.
- 대표 오답 및 오류 원인: 문자형 변수(String)라고만 답하고 통계적 변수 유형인 명목형을 밝히지 않는 경우가 있습니다.
1-3. 독성 심각도 등급 (Grade 1, Grade 2, Grade 3)
- 단계 1 (척도 분석): Grade 1 < Grade 2 < Grade 3의 명확한 순서 관계가 존재합니다.
- 단계 2 (간격 검증): Grade 1에서 Grade 2로의 심각도 증가량이 Grade 2에서 Grade 3으로의 심각도 증가량과 물리적으로 동일하다고 단정할 수 없습니다.
- 단계 3 (분류): 순서는 존재하지만 간격이 일정하지 않으므로 **범주형-순서형 변수(Ordinal Categorical Variable)**에 해당합니다.
- 대표 오답 및 오류 원인: 숫자 1, 2, 3이 포함되어 있다고 해서 연속형 수치 변수로 오인하여 평균을 계산하려는 오류가 빈번합니다.
1-4. Well 당 형성된 콜로니 개수 (45개, 52개, 38개)
- 단계 1 (척도 분석): 셀 수 있는 개수(Count) 데이터이며 소수점이 존재하지 않는 정수(Integer) 형태입니다.
- 단계 2 (분류): 수치형 변수 중 **계수형/이산형 변수(Discrete / Count Numerical Variable)**에 해당합니다. 단위는
개또는colonies입니다.
1-5. 세포 생존율 (72.4%, 81.1%, 65.8%)
- 단계 1 (척도 분석): 측정 장비의 정밀도에 따라 소수점 아래 연속적인 실수를 가질 수 있는 척도입니다.
- 단계 2 (분류): 수치형 변수 중 **연속형 변수(Continuous Numerical Variable)**에 해당합니다. 단위는
%입니다.
[문제 2] 세포 생존율 변화 분석 (%p vs %)
2-1. 세포 생존율의 절대적 변화량 (%p)
- 공식:
- 계산 과정:
- 정답 단위:
7.0 %p(퍼센트 포인트) - 대표 오답:
7.0% - 오답 원인 분석: 퍼센트 기호(%)가 붙은 두 수치의 차이를 구할 때 단위 지식 부족으로 단순
%를 그대로 붙여 표기함. 이는 relative change 7%와 혼동을 유발하므로 명백한 오류입니다.
2-2. 대조군 대비 처리군의 상대적 생존율 변화율 (%)
- 공식:
- 계산 과정:
- 정답 단위:
10.0 %(퍼센트) - 대표 오답:
10.0 %p또는7.0 % - 오답 원인 분석: 상대 변화율 계산 공식의 분모에 대조군 기준값(70.0%)을 넣지 않고 절대 차이값만 기재하거나, 결과 단위에 %p를 잘못 결합함.
[문제 3] 실무 데이터 오류 진단 및 보고서 수정
3-1. 오류 원인 상세 진단
연구원이 데이터베이스에 기록된 약물 그룹 코드(1=Control, 2=Treatment A, 3=Treatment B)를 수치형 연속 변수로 인식하고 평균을 계산했습니다.
- 그룹 코드 숫자는 단순히 개별 처리 조건을 식별하기 위한 범주형-명목형(Nominal) 기호에 불과합니다.
- 코드 '2'가 코드 '1'의 2배 양적 가치를 갖지 않으며, 평균값 '2.0'은 Treatment A를 의미하는 범주 이름이지 수치적 중앙값이 아닙니다.
- 명목형 변수에서 산술 평균(Mean)을 구하는 것은 수학적·통계적으로 정의되지 않은 연산입니다.
3-2. 올바른 분석 방안 및 보고서 교정안
- 올바른 통계 요약: 약물 그룹 변수는 수치 평균이 아닌 **각 범주별 빈도수(Count) 및 비율(Percentage)**로 요약해야 합니다.
- 교정된 보고서 문장:
"본 실험에서는 대조군(Control, ID=1) 10개 well, 처리군 A(Treatment A, ID=2) 10개 well, 처리군 B(Treatment B, ID=3) 10개 well을 포함하여 총 30개 well의 데이터를 분석하였습니다 (각 조건별 비중 33.3%). 각 약물 처리군별 세포 생존율(%)의 평균과 표준편차는 별도로 산출하였습니다."
핵심 정리와 다음 강의
이 강의의 계산은 합성 자료를 이해하기 위한 것이다. 계산값이 어느 대상과 단위에서 나왔는지 밝히고, 한 개의 요약값이 말할 수 없는 범위를 함께 기록해야 한다. 다음 강의에서는 이 구분을 한 단계 더 확장한다.