목록으로

변수와 X·Y를 처음부터 이해하기

바이오 실험의 작은 숫자와 데이터 구조를 이용해 변수와 X·Y를 처음부터 이해하기를 처음부터 단계적으로 배웁니다.

입문
|
25
|
검증 완료 (2026-08-13)
JMP생물통계학바이오 실험기초통계
진행률0/10 (0%)

01. 오늘 해결할 문제

실험실에서 세포 배양 실험을 진행한 후 얻은 데이터 노트에 95.2, 81.4, 63.0, 41.8이라는 숫자만 나열되어 있다고 가정해 보겠습니다. 이 숫자들은 무엇을 의미할까요?

단순히 숫자만 적힌 목록은 아무런 통계적·과학적 정보도 전달하지 못합니다. 이 숫자가 화합물 A의 투여 농도(μM\mu\text{M})인지, 48시간 후 측정한 세포 생존율(Viability, %)인지, 아니면 배양기의 온도(C{}^\circ\text{C})인지 알 수 없기 때문입니다.

바이오 통계와 품질 설계(QbD, Quality by Design)에서 데이터를 분석하기 위해 가장 먼저 해야 할 일은 각 관측값에 이름을 부여하고 그 관측값이 전체 시스템에서 맡은 역할(Role)을 지정하는 것입니다.

오늘 우리는 관측된 측정값을 **변수(Variable)**로 정의하고, 원인이 되는 입력(Factor / X), 반응이 일어나는 공정 체계(Process), 그 결과로 얻어지는 **반응(Response / Y)**의 구조를 정립합니다. 또한, 단순히 X와 Y를 그래프에 그렸다고 해서 인과관계가 자동으로 입증되지 않는 이유와, 우리를 속이는 **혼란변수(Confounder)**의 위험성을 명확히 구분해 봅니다.


02. 초보자의 첫 생각

통계나 데이터 분석을 처음 접하는 연구자들은 종종 다음과 같은 세 가지 고정관념이나 오해에 빠지곤 합니다.

  1. "X와 Y의 그래프에 점을 찍었더니 예쁜 직선이 나왔으니, X가 Y의 확실한 인과적 원인이다." 그래프 상에서 두 변수가 함께 변하는 것처럼 보인다고 해서 X가 Y를 직접 변화시킨 원인이라고 단정할 수 없습니다. 시간의 경과나 배양기 내부의 미세한 온도 차이 같은 제3의 변수가 두 변수 모두에 영향을 주었을 가능성이 항상 존재합니다.

  2. "배치 번호, 측정 날짜, 선반 위치 같은 배경 정보는 결과 수치에 직접 관여하지 않으므로 변수로 기록할 필요가 없다." 실험 결과에 영향을 주는 것은 내가 관심 있는 독성 물질뿐만이 아닙니다. 배양기 선반의 위치나 세포 접종량의 미세한 차이 같은 배경 요소들도 Y값을 흔드는 주요 원인이 됩니다. 이를 기록하지 않으면 나중에 원인을 찾을 수 없는 무작위 변동으로 남게 됩니다.

  3. "숫자 데이터만 엑셀에 깔끔하게 적어두면 단위와 측정 시점은 나중에 머릿속으로 기억해낼 수 있다." 단위(μM\mu\text{M}, %, hours)와 측정 시점(Timestamp)이 누락된 수치는 재현 불가능한 쓰레기 데이터(Garbage Data)가 됩니다. 같은 숫자라도 측정 시점에 따라 전혀 다른 생물학적 의미를 갖습니다.


03. 직관 만들기

세포 배양 6-well 플레이트 실험을 직관적인 모델로 만들어 보겠습니다.

우리는 배양용 웰(Well) 속에 세포를 넣고, 세포에 영향을 주는 실험 조건인 화합물 A의 농도를 0, 10, 50, 100 μM\mu\text{M}으로 다르게 투여합니다. 투여된 화합물은 세포 내부의 생화학적 반응 체계(Process)를 거치게 되며, 48시간이 지난 후 우리는 세포의 **생존율(Viability, %)**을 측정합니다.

이 구조에서 각 요소의 직관적 역할은 다음과 같습니다.

  • 입력 (Input X): 우리가 능동적으로 조절하거나 관측하고자 부여한 조건 (예: 화합물 A의 농도).
  • 공정/반응 체계 (Process): 입력 조건이 주어졌을 때 실제 생물학적·화학적 변화가 일어나는 대상 (예: 웰 내부 세포의 대사 과정).
  • 결과/반응 (Output Y): 공정을 거쳐 최종적으로 관측·측정한 반응 결과 (예: 48시간 후 세포 생존율 %).

입력 X를 변화시켰을 때 결과 Y가 어떻게 바뀌는지 관측하는 것이 실험의 기본 틀입니다. 그러나 입력 X에서 결과 Y로 가는 길목에는 실험자가 제어하지 못한 다양한 환경 변수와 노이즈(ϵ\epsilon)가 개입하게 됩니다.


04. 필요한 용어

바이오 통계와 품질 관리 체계에서 사용하는 핵심 용어들을 정립해 둡니다.

  1. 변수 (Variable) 관측 대상(예: 세포 배양 웰, 시험관)마다 서로 다른 값을 가질 수 있는 관측 가능한 속성이나 수치입니다. (예: 농도, 생존율, 온도, 측정 시각)

  2. 입력 변수 / 요인 (Factor / Input Variable / X) 실험자가 결과를 관측하기 위해 제어하거나 조건으로 설정한 변수입니다. 의약품 품질 고도화(QbD) 접근법에서는 제품 품질에 영향을 미칠 수 있는 공정 입력 변수를 **핵심 공정 변수(CPP, Critical Process Parameter)**라고 부릅니다.

  3. 반응 변수 / 결과 변수 (Response / Output Variable / Y) 입력 조건의 결과로 나타나는 측정값입니다. QbD 체계에서는 의약품의 안전성과 유효성을 나타내는 핵심 품질 측정 항목을 **핵심 품질 특성(CQA, Critical Quality Attribute)**이라고 부릅니다.

  4. 혼란변수 (Confounder / Confounding Variable) 입력 X와 반응 Y 모두에 직·간접적인 영향을 주어, 실제로는 X와 Y 사이에 아무런 인과관계가 없거나 다른 양상이 존재함에도 불구하고 마치 강한 관계가 있는 것처럼 착시를 일으키는 제3의 배경 변수입니다.

  5. 개입 (Intervention) 단순히 자연 상태를 관찰하는 것을 넘어, 연구자가 계획에 따라 무작위 배정(Randomization) 등을 통해 입력 X를 능동적으로 변경하고 외부 요인을 통제하는 실험적 행위입니다.

  6. 단위 (Unit) 및 메타데이터 (Metadata) 숫자 데이터의 물리적 의미를 지정하는 표준 단위(μM\mu\text{M}, %, C{}^\circ\text{C})와 측정 시점(Timestamp, hours), 웰의 위치 정보 등 데이터를 설명하는 데이터입니다.


05. 수학·통계 bridge

수학과 통계학에서는 입력 X와 결과 Y의 관계를 다음과 같은 함수적 구조로 표현합니다.

Y=f(X)+ϵY = f(X) + \epsilon

여기서 각 기호가 갖는 의미는 다음과 같습니다.

  • YY: 관측된 반응 변수 (예: 세포 생존율 %)
  • XX: 입력 변수 (예: 화합물 A 농도 μM\mu\text{M})
  • f(X)f(X): 입력 X가 결과 Y에 영향을 미치는 체계적이고 결정론적인 관계 (Systematic Relationship)
  • ϵ\epsilon (Epsilon): 미처 통제하지 못한 미세한 환경 변동, 측정 오차, 생물학적 무작위 변동(Random Error / Noise)

상관관계와 인과관계의 수학적 구분

두 변수 XXYY 사이의 선형 연관성을 나타내는 상관계수(Pearson Correlation Coefficient)를 r(X,Y)r(X, Y)라고 할 때:

r(X,Y)0    X와 Y 사이에 선형적 상관관계가 존재함r(X, Y) \neq 0 \implies X \text{와 } Y \text{ 사이에 선형적 상관관계가 존재함}

그러나 이것이 곧 XYX \to Y의 인과관계(Causation)를 의미하지는 않습니다.

수학적으로 인과성을 주장하기 위해서는 단순한 상관계수 측정뿐만 아니라, 개입(Intervention) 상태에서 다른 모든 혼란변수 ZZ를 고정(Control\text{Control})했을 때도 XX의 변화에 따라 YY의 조건부 확률 분포가 변함을 증명해야 합니다.

데이터 테이블에서의 표현

통계 데이터 테이블(Data Table)에서 행과 열은 다음과 같은 대수적 구조를 갖습니다.

\text{Row 1} \\ \text{Row 2} \\ \vdots \\ \text{Row } n \end{bmatrix} \times \begin{bmatrix} \text{ID} & X (\text{Factor}) & Y (\text{Response}) & Z (\text{Confounder}) \end{bmatrix}$$ - **행 (Row)**: 독립적인 관측 단위 (Observation Unit, 예: 개별 well) - **열 (Column)**: 동일한 속성을 측정한 변수 (Variable, 예: Concentration, Viability, Shelf) --- ## 06. 원자료 기반 바이오 사례 합성 세포 배양(Synthetic Cell Culture) 6-well 플레이트 2개(총 $n=12$ wells)에서 수집한 교육용 데이터 사례를 살펴보겠습니다. 아래 표는 12개 웰을 가정해 만든 합성 데이터의 구조입니다. | Well_ID | Treatment_Conc ($\mu\text{M}$) | Incubation_Time (h) | Cell_Viability (%) | Incubator_Shelf | | :--- | :--- | :--- | :--- | :--- | | Well_A01 | 0 | 48 | 96.1 | Upper | | Well_A02 | 0 | 48 | 94.5 | Upper | | Well_A03 | 10 | 48 | 90.2 | Upper | | Well_A04 | 10 | 48 | 88.9 | Upper | | Well_A05 | 50 | 48 | 72.3 | Upper | | Well_A06 | 50 | 48 | 70.8 | Upper | | Well_B01 | 0 | 48 | 91.0 | Lower | | Well_B02 | 0 | 48 | 89.8 | Lower | | Well_B03 | 10 | 48 | 84.2 | Lower | | Well_B04 | 10 | 48 | 83.1 | Lower | | Well_B05 | 100 | 48 | 48.5 | Lower | | Well_B06 | 100 | 48 | 46.9 | Lower | 이 데이터에서 변수들의 역할을 분석해 보면: - **Treatment_Conc ($\mu\text{M}$)**: 입력 변수 X (연구자가 조절한 화합물 농도) - **Cell_Viability (%)**: 반응 변수 Y (측정한 세포 생존율) - **Incubation_Time (h)**: 고정된 배경 메타데이터 (48시간 통제) - **Incubator_Shelf**: 잠재적 혼란변수 (상단 선반 Upper와 하단 선반 Lower 사이의 미세 온도 차이) --- ## 07. 데이터 생성 구조 이 데이터가 실제로 생성된 내재적 생물학·물리적 구조(Data Generation Process)를 방정식 형태로 분해해 보겠습니다. $$\text{Viability} (\%) = 95.0 - 0.45 \times \text{Treatment\_Conc} - 4.5 \times \mathbb{I}(\text{Shelf} = \text{Lower}) + \epsilon$$ 여기서 $\mathbb{I}(\text{Shelf} = \text{Lower})$는 배양판이 하단 선반에 위치할 때 1, 상단 선반에 위치할 때 0을 갖는 지시 변수(Indicator Variable)입니다. 이 구조가 시사하는 바는 매우 중요합니다. 1. **처리 효과 (X의 효과)**: 화합물 농도가 $1\,\mu\text{M}$ 증가할 때마다 세포 생존율은 평균적으로 $0.45\%$ 감소합니다. 2. **혼란 효과 (Confounder의 효과)**: 배양기 하단 선반(Lower)은 상단 선반(Upper)에 비해 문 열림에 따른 미세한 온도 저하로 인해 농도 조건과 상관없이 생존율을 추가로 $4.5\%$ 떨어뜨립니다. 만약 연구자가 하단 선반에 고농도($100\,\mu\text{M}$) 처리 웰만 모아두고 상단 선반에 대조군($0\,\mu\text{M}$)을 모아두었다면, 관측된 높은 생존율 저하가 **화합물의 독성 때문인지, 배양기 선반의 온도 차이 때문인지 구분할 수 없게 됩니다.** 이것이 바로 혼란(Confounding) 현상입니다. --- ## 08. 분석 전 Gate 데이터 수집이 완료된 후 통계 분석을 시작하기 전, 반드시 통과해야 하는 **4가지 사전 검증 Gate**입니다. ``` [원자료 데이터 테이블] │ ▼ [Gate 1: 변수 역할 지정] ──▶ X(Factor), Y(Response), Z(Confounder) 역할이 명확한가? │ (Yes) ▼ [Gate 2: 단위 및 메타데이터] ──▶ 모든 수치에 표준 단위와 측정 시점이 명시되었는가? │ (Yes) ▼ [Gate 3: 혼란변수 통제 확인] ──▶ 무작위 배치나 무작위 블록화가 적용되었는가? │ (Yes) ▼ [Gate 4: 인과/상관 경계 입증] ──▶ 단순 관측인가, 능동적 개입(Intervention) 데이터인가? │ (Pass) ▼ [본격적 통계 분석 진행] ``` 1. **Gate 1 (변수 역할 명확화)**: 각 열이 입력 X, 결과 Y, 통제 변수 Z 중 어느 역할을 맡고 있는지 문서화되었는가? 2. **Gate 2 (단위 및 측정 시점 검증)**: 수치 옆에 정확한 단위($\mu\text{M}$, %, h)가 결합되어 있는가? 3. **Gate 3 (혼란 변수 제어 확인)**: 선반 위치, 측정 순서 등의 외부 요인이 특정 X 조건에 편향되어 배치되지 않았는가? 4. **Gate 4 (상관-인과 해석 경계)**: 이 데이터가 관측 데이터(Observational Data)인지 개입 실험 데이터(Experimental Data)인지 명시했는가? --- ## 09. JMP 19.1 실행 `이 글에서는 해당 없음 (CONCEPT_ONLY)` *이유*: 본 아티클은 변수(Variable)의 정의, X와 Y의 역할 구분, 혼란변수 및 상관과 인과의 구분이라는 데이터 표현의 기초 개념을 다루는 이론편(Foundation)입니다. 실제 JMP 19.1 소프트웨어의 데이터 테이블 구성, 메뉴 조작 및 Column Role (X, Factor / Y, Response) 지정 절차는 P00 파트의 종합 실습 아티클인 `BJS-P00-A014`에서 다룹니다. --- ## 10. 출력 읽기 `이 글에서는 해당 없음 (CONCEPT_ONLY)` *이유*: JMP 소프트웨어 실행 및 통계 모형 적합을 수행하지 않는 개념 단계이므로 통계 보고서 및 출력 분석표는 생성되지 않습니다. --- ## 11. 틀린 지름길 변수와 X·Y의 관계를 다룰 때 자주 발생하는 대표적인 분석 오류 3가지입니다. ``` ┌────────────────────────────────────────────────────────────────────────┐ │ 흔히 범하는 3가지 잘못된 지름길 │ ├────────────────────────────────────────────────────────────────────────┤ │ 1. 상관계수 맹신: r=0.98이 나오면 X가 Y의 인과적 원인이라고 단정한다. │ │ 2. 메타데이터 누락: 단위와 측정 시각을 지우고 숫자만 엑셀에 적어둔다. │ │ 3. 환경 변수 무시: 배양기 위치, 측정 일자 같은 배경 변수를 무시한다. │ └────────────────────────────────────────────────────────────────────────┘ ``` 1. **상관계수가 높으면 무조건 인과관계라고 단정하는 지름길** 두 변수가 함께 움직이는 상관계수 $r=0.95$가 측정되었더라도, 그것이 인과관계를 의미하지는 않습니다. 여름철 아이스크림 판매량과 물놀이 사고 건수는 강한 양의 상관관계를 보이지만, 아이스크림이 물놀이 사고의 원인이 아니라 '기온 상승'이라는 제3의 변수가 원인인 것과 같습니다. 2. **단위와 측정 시점을 생략하고 수치만 기록하는 지름길** `95.2`라는 숫자는 $\mu\text{M}$ 농도에서의 생존율인지, 24시간 시점의 값인지, 48시간 시점의 값인지 알 수 없으면 분석 불가능한 쓰레기 데이터가 됩니다. 3. **환경 변수를 미지정 노이즈로 덮어버리는 지름길** 배양판의 위치(Shelf Location)나 실험 수행 일자 같은 배경 변수를 기록하지 않고 버리면, 나중에 상단 선반과 하단 선반의 차이로 인해 발생한 데이터 변동을 설명할 수 없게 됩니다. --- ## 12. 보고·한계 데이터 결과를 보고서나 논문에 작성할 때 준수해야 할 원칙과 연구 한계 설정 방법입니다. ### 보고서 작성 원칙 1. **변수의 역할과 단위 명시**: 모든 그래프와 표의 축에는 변수명과 함께 반드시 측정 단위($\mu\text{M}$, %, h)를 표기해야 합니다. 2. **관측과 개입의 명확한 구별**: 능동적 무작위 할당(Randomized Intervention)을 거치지 않은 관측 데이터인 경우, "X와 Y 사이에 양의 상관관계가 관찰되었다"라고 표현해야 하며 "X가 Y를 증가시켰다"라는 인과적 표현을 사용해서는 안 됩니다. ### 한계점 명시 (Limitations) - **합성 데이터의 한계**: 본 아티클에 사용된 데이터는 개념 이해를 돕기 위한 **교육용 합성 데이터(Synthetic Data)**이며, 실제 생체 내(in vivo) 반응이나 제약 산업의 배치 생산 공정을 직접 대표하지 않습니다. - **미측정 혼란변수(Unmeasured Confounders)**: 배양기 내부 미세 기류, 배지 웰 간 용매 증발량 등 측정되지 않은 잠재적 혼란변수의 영향이 완전히 배제되지 않았음을 보고서 한계 섹션에 기술해야 합니다. --- ## 연습문제 ### 안내 사항 본 연습 문제는 본문 `BJS-P00-A005`에서 학습한 변수의 정의, 입력(X)과 반응(Y)의 역할 구분, 혼란변수(Confounder), 그리고 상관관계와 인과관계의 차이를 직접 적용해 보는 과제입니다. **주의**: 본 문서에는 정답과 해설이 포함되어 있지 않습니다. 문제를 풀이한 후 [BJS-P00-A005-variables-x-and-y-ANSWER-v02.md](BJS-P00-A005-variables-x-and-y-ANSWER-v02.md) 문서에서 상세 해설을 확인하세요. ### 문제 1. 실험 변수의 역할 구분하기 어느 바이오 연구실에서 신규 항암 화합물 A의 세포 독성을 평가하기 위해 세포 배양 6-well 플레이트 실험을 수행했습니다. 연구자는 다음과 같은 데이터 항목들을 수집했습니다. - 항목 A: 배양액에 투여한 화합물 A의 농도 ($0, 10, 50, 100\,\mu\text{M}$) - 항목 B: 48시간 후 측정한 세포 생존율 (Cell Viability, %) - 항목 C: 배양기(Incubator) 내 배양판의 선반 위치 (상단 선반 Upper vs 하단 선반 Lower) ### [질문 1-1] 항목 A, B, C를 다음 변수 역할 중 하나로 올바르게 매핑하고, 그렇게 판단한 이유를 1~2문장으로 기술하세요. 1. 입력 변수 (Factor / X / CPP) 2. 반응 변수 (Response / Y / CQA) 3. 잠재적 혼란변수 (Confounder) ### 문제 2. 상관관계 vs 인과관계 및 개입 평가 한 연구원이 20개의 서로 다른 세포 배양 용기에서 측정한 관측 데이터를 수집했습니다. 세포 밀도(Cell Density)와 최종 생존율(Viability)의 상관계수를 계산해보니 $r = 0.94$로 매우 높은 양의 선형 관계가 관찰되었습니다. 연구원은 보고서에 다음과 같이 결론을 내렸습니다. ### [질문 2-1] 연구원의 이 결론이 통계적·과학적으로 왜 위험하거나 틀렸는지 설명하세요. 인과관계를 증명하기 위해 부족한 요소(개입, 혼란변수 통제 등)를 포함하여 2~3문장으로 기술하세요. ### 문제 3. 완전한 변수 데이터 테이블 작성 아래 표는 어느 초보 연구자가 엑셀에 작성한 세포 배양 데이터의 일부입니다. | Sample | Conc | Time | Via | Temp | | :--- | :--- | :--- | :--- | :--- | | A01 | 0 | 48 | 95.2 | 37.0 | | A02 | 10 | 48 | 91.0 | 37.1 | | B01 | 50 | 48 | 74.8 | 36.9 | | B02 | 100 | 48 | 52.3 | 37.0 | ### [질문 3-1] 현재 표 데이터는 데이터를 명확히 표현하는 변수 규격 관점에서 몇 가지 치명적인 누락이 존재합니다. 이 표를 통계 분석 및 재현이 가능한 **완전한 데이터 테이블**로 교정하여 작성하고, 교정한 핵심 항목(열 이름, 단위, 메타데이터 등)을 설명하세요. ## 정답 및 해설 ### 문제 1 해설 및 정답: 실험 변수의 역할 구분하기 ### 1-1. 정답 - **입력 변수 (Factor / X / CPP)**: 화합물 A 농도 (Compound A Concentration) — 단위: $\mu\text{M}$ - **반응 변수 (Response / Y / CQA)**: 세포 생존율 (Cell Viability) — 단위: % - **잠재적 혼란변수 (Confounder)**: 배양기 선반 위치 (Incubator Shelf Location) 및 세포 접종량 미세 차이 — 단위: 범주형 위치(Upper/Lower) / 세포 수(\text{cells/well}) ### 1-2. 단계별 풀이 과정 1. **X(입력) 식별**: 연구자가 실험 설계 시 직접 고정하거나 조절한 처리 조건은 화합물 A의 투여 농도(0, 10, 50, 100 $\mu\text{M}$)입니다. 따라서 이것이 입력 변수 X입니다. QbD 관점에서는 세포 생존 체계에 영향을 미치는 핵심 공정 변수(CPP) 후보가 됩니다. 2. **Y(결과) 식별**: 입력 조건 적용 후 48시간 뒤에 측정하여 공정/반응의 성패를 평가한 최종 수치는 세포 생존율(%)입니다. 따라서 이것이 반응 변수 Y입니다. QbD 관점에서는 핵심 품질 특성(CQA)입니다. 3. **혼란변수 식별**: 실험자가 의도적으로 다르게 주지 않았으나 배양기 내 상단/하단 온도 미세 차이나 웰 간 접종량 오차는 X(농도 배치)와 Y(생존율) 모두에 의도치 않은 영향을 줄 수 있는 배경 환경 요소입니다. 따라서 혼란변수(Confounder)로 지정하고 통제해야 합니다. ### 1-3. 대표 오답 및 오답 원인 분석 - **대표 오답**: "배양기 선반 위치(Shelf Location)는 실험실 환경이므로 입력 변수 X2로 본다." - **오답 이유**: 선반 위치는 연구자가 세포 반응 기전을 탐구하기 위해 투여한 주 처리 입력(Factor)이 아니라, 통제되어야 할 배경 환경 소음(Noise / Confounder)입니다. 이를 입력 변수 X2로 오인하여 주 효과로 해석하면 실제 화합물 A의 인과적 효과 크기가 왜곡됩니다. ### 문제 2 해설 및 정답: 상관관계 vs 인과관계 및 개입 평가 ### 2-1. 정답 - **판단**: **잘못된 결론 (신뢰할 수 없음)** - **이유**: 단순 관측 데이터에서 구한 높은 상관계수($r = 0.94$)는 인과관계를 증명하지 않습니다. 시간의 경과(Incubation Time)나 온도 변동이라는 제3의 혼란변수에 의해 두 변수가 동시에 변했을 가능성이 존재하며, 능동적 개입(Intervention)과 혼란변수 통제가 무작위 배정으로 이루어지지 않았기 때문입니다. ### 2-2. 단계별 풀이 과정 1. **상관계수 $r=0.94$의 의미 해석**: 이는 세포 밀도(X)가 높을 때 생존율(Y)도 높게 측정되는 직선적 경향(Correlation)이 강하다는 뜻일 뿐, 밀도가 높아졌기 때문에 생존율이 상승했음을 뜻하지 않습니다. 2. **제3의 변수(혼란변수) 탐색**: 예를 들어 배양 시간이 진행됨에 따라 세포도 늘어나고 생존율 측정을 위한 배지 조건이 최적화되었다면, '시간 경과'라는 제3의 변수가 X와 Y를 동시에 증가시킨 원인일 수 있습니다. 3. **인과 입증 조건 확인**: 인과관계를 증명하려면 타당한 개입(Intervention) 구조, 즉 세포 밀도를 무작위로 다르게 할당(Randomization)하고 배양 시간, 온도, 배지 조성을 완전히 동일하게 고정한 무작위 통제 실험을 거쳐야 합니다. ### 2-3. 대표 오답 및 오답 원인 분석 - **대표 오답**: "상관계수가 0.94로 1에 매우 가까우므로 세포 밀도를 높이면 생존율이 증가한다는 인과관계가 통계적으로 증명되었다." - **오답 이유**: 상관계수의 크기($r$)는 두 변수의 함께 변하는 선형 경향의 세기만 측정할 뿐, 방향성(원인 $\to$ 결과)이나 혼란변수의 부재를 보장하지 않습니다. 상관을 인과로 단정하는 것은 통계학 및 바이오 연구에서 가장 흔히 발생하는 대표적인 논리적 오류입니다. ### 문제 3 해설 및 정답: 완전한 변수 데이터 테이블 작성 ### 3-1. 정답 올바르게 교정된 완전한 변수 데이터 테이블은 다음과 같습니다. | Sample_ID | Treatment_Conc ($\mu\text{M}$) | Measurement_Time (h) | Viability (%) | Incubator_Temp (${}^\circ\text{C}$) | | :--- | :--- | :--- | :--- | :--- | | Well_A01 | 0 | 48 | 95.2 | 37.0 | | Well_A02 | 10 | 48 | 91.0 | 37.1 | | Well_B01 | 50 | 48 | 74.8 | 36.9 | | Well_B02 | 100 | 48 | 52.3 | 37.0 | ### 3-2. 단계별 풀이 과정 1. **열 이름의 역할 표기 및 단위 추가**: - `Conc` $\to$ `Treatment_Conc ($\mu\text{M}$)` (입력 변수 X) - `Time` $\to$ `Measurement_Time (h)` (측정 시점 메타데이터) - `Via` $\to$ `Viability (%)` (반응 변수 Y) - `Temp` $\to$ `Incubator_Temp (${}^\circ\text{C}$)` (환경 변수 / 통제 변수) 2. **숫자 데이터의 단위 연계 검증**: - 0, 10, 50, 100이 마이크로몰($\mu\text{M}$)인지 밀리몰($\text{mM}$)인지 불분명했던 점을 명시함. - 95.2, 91.0 등의 수치가 흡광도(Absorbance) 원시값이 아니라 상대적 생존율(%)임을 명확히 표현함. 3. **측정 시점(Timestamp) 통일**: - 모든 웰의 데이터가 동일하게 48시간(h) 시점에서 측정되었음을 기록하여 시간차에 의한 변동 오염을 배제함. ### 3-3. 대표 오답 및 오답 원인 분석 - **대표 오답**: "표의 숫자 자체가 정확하므로 `Conc`, `Via` 표기만으로 충분하며 단위는 보고서 텍스트 설명으로 대체한다." - **오답 이유**: 데이터 테이블의 열 이름과 단위가 분리되면 데이터 교환, 재분석 또는 JMP와 같은 통계 소프트웨어 로딩 시 단위 혼선(예: $\mu\text{M}$을 $\text{mM}$으로 착각하거나 48시간 데이터를 24시간 데이터와 혼용)이 발생하여 심각한 분석 오류를 유발합니다. 모든 수치는 단위 및 메타데이터와 결합하여 저장되어야 합니다. ## 핵심 정리와 다음 강의 이 강의의 계산은 합성 자료를 이해하기 위한 것이다. 계산값이 어느 대상과 단위에서 나왔는지 밝히고, 한 개의 요약값이 말할 수 없는 범위를 함께 기록해야 한다. 다음 강의에서는 이 구분을 한 단계 더 확장한다.

💬 질문과 댓글

0개의 댓글

로그인 없이 작성할 수 있습니다. 비로그인 댓글은 작성 후 직접 수정·삭제할 수 없습니다.

0/2000

로딩 중...