목록으로

두 집단을 올바르게 비교한다: 독립·대응·Welch의 선택

두 집단 평균 비교에서 독립표본과 대응표본, pooled와 Welch, 정규·비정규 대안을 데이터 생성 구조에 맞게 구분한다.

중급
|
30
|
검증 완료 (2026-08-14)
독립표본대응표본Welch t-testpooled t-testrank testpseudoreplicationJMP
진행률0/19 (0%)

처리 A와 B를 각각 다른 batch에 적용한 실험과, 같은 donor의 세포를 둘로 나누어 A와 B를 적용한 실험은 모두 두 열의 숫자를 만듭니다. 그러나 두 분석의 오차 단위는 같지 않습니다.

이번 단원의 질문은 하나입니다.


독립·대응, 등분산·이분산, 정규·비정규를 왜 데이터 구조에서 먼저 구분해야 하는가?

독립표본한 관측이 다른 관측과 짝지어지지 않음
대응표본같은 단위의 전후처럼 차이가 짝을 이룸
pooled t두 분산이 같다는 모형을 공유
Welch t집단별 분산과 n을 따로 반영

독립과 대응은 표 모양이 아니라 생성 관계입니다

독립표본에서는 A의 한 관측과 B의 특정 관측이 자연스럽게 짝지어지지 않습니다. 서로 다른 donor, batch, animal 또는 독립 배양이 예입니다. 평균 차이의 SE는 두 집단의 변동을 함께 반영합니다.

대응표본에서는 같은 실험단위의 전후, 좌우, matched pair처럼 두 값이 하나의 쌍을 이룹니다. 분석 대상은 두 원자료 열이 아니라 쌍별 차이 dᵢ=Bᵢ−Aᵢ입니다. 개체마다 큰 baseline 차이가 있어도 쌍 안에서 상쇄될 수 있습니다.

U10 · Figure 01
독립 비교와 대응 비교는 오차가 계산되는 단위부터 다릅니다
독립 A독립 BA−B 비교같은 단위 전같은 단위 후쌍별 차이
독립표본은 두 집단의 변동을 합치고, 대응표본은 각 쌍의 차이를 분석합니다. 짝 정보가 없는데 대응으로 만들거나 그 반대이면 복구할 수 없습니다.

짝은 데이터 뒤에 비슷해 보이는 행을 연결해 만드는 것이 아닙니다. 설계에서 정해져야 합니다. 반대로 진짜 쌍 정보를 버리고 독립 분석을 하면 유용한 정보와 검정력을 잃을 수 있습니다.

독립 두 평균에는 적어도 두 표준오차 모형이 있습니다

평균 차이 x̄B−x̄A는 같아도 SE 계산이 다릅니다.

pooled t는 두 모집단 분산이 같다는 가정 아래 두 표본분산을 하나로 합칩니다. Welch t는 sA²/nA + sB²/nB를 사용해 집단별 분산과 n을 따로 반영하고, 그 불확실성에 맞춰 자유도를 조정합니다.

집단 크기가 같고 산포가 비슷하면 두 결과는 거의 같을 수 있습니다. n과 분산이 동시에 크게 다르면 pooled 결과는 왜곡될 수 있습니다. 분석 계획에서 Welch를 강건 기본값으로 선택할 수 있지만, 분산 검정 p값을 보고 매번 바꾸는 자동 절차는 피합니다.

가장 위험한 오류는 pseudoreplication입니다

한 donor에서 얻은 12개 well을 독립 donor 12명처럼 분석하면 n과 자유도가 부풀어 오릅니다. 기술반복 평균을 donor 한 행으로 만들거나 계층모형으로 구조를 표현해야 합니다. 어떤 t-test를 택하느냐보다 실험단위를 바로 세는 것이 먼저입니다.

대응 t-test는 ‘두 집단 검정’보다 one-sample 차이 검정에 가깝습니다

쌍별 차이의 평균 , SD s_d, 쌍 수 n으로 t=d̄/(s_d/√n)을 계산합니다. 따라서 가정도 각 조건의 원자료가 각각 정규인가보다 차이값의 분포와 쌍의 독립성에 초점이 있습니다.

일부 쌍의 한쪽 값이 빠지면 complete pairs 수가 줄어듭니다. 결측 원인이 처리나 반응과 연관될 수 있다면 완전 사례만 남기는 것이 편향을 만들 수 있으므로 결측 구조를 보고하고 적절한 모형을 계획해야 합니다.

비모수는 ‘가정 없는 평균 검정’이 아닙니다

Mann–Whitney/Wilcoxon rank-sum은 순위를 사용하지만 일반적으로 평균 차이를 직접 검정하지 않습니다. 분포 모양이 같고 위치만 이동한다는 조건에서 위치 차이로 해석하기 쉬워집니다. paired Wilcoxon signed-rank도 차이의 대칭성 등 해석 조건이 있습니다.

극단값이 있다고 자동으로 rank test로 바꾸지 마십시오. 이상값의 원인, 질문이 평균인지 중앙 위치인지, 검출한계·순서척도인지 먼저 확인합니다. permutation, bootstrap, 강건 추정과 명시적 모형도 후보입니다.

In-Silico Lab: 같은 효과를 두 구조로 분석합니다

  1. independent에서 SD 비를 바꾸며 Welch SE와 pooled SE를 비교합니다.
  2. paired에서 같은 baseline을 공유할 때 쌍별 차이 SE가 어떻게 줄어드는지 봅니다.
  3. 효과 0에서 seed를 바꾸어 어느 구조에서도 거짓 양성이 가능한지 확인합니다.
  4. 짝을 임의로 재배열하면 paired 이점이 유지될지 생각합니다.
In-Silico Lab · U10

독립과 대응은 같은 숫자 두 열이 아닙니다

독립 집단의 Welch 비교와 같은 단위 전후의 쌍별 차이를 바꾸어 표준오차가 만들어지는 구조를 비교합니다.

같은 설정의 합성 관측

AB

계산 결과

B−A1.70
Welch SE0.98
pooled SE0.98
양측 p0.0808

대응은 공유된 개체 차이를 쌍 안에서 제거합니다. 임의로 행을 짝지으면 이 이점은 가짜입니다.

교육용 synthetic model · bjs-comparison-sequence-v1. 실제 연구 판단에는 실험단위, 결측, 분포, 다중성, 사전계획과 도메인 기준을 별도로 반영해야 합니다.

Lab의 z 근사는 관계를 투명하게 보여주기 위한 것입니다. 실제 t 절차에서는 표본 SD와 자유도, 불균형 n, 결측을 반영합니다.

JMP 결과 이름은 모형 가정을 드러냅니다

Pooled t / Welch t

가정이 다른 두 추정량의 차이·SE·CI를 구분합니다.

Matched Pairs

짝의 차이를 한 집단 자료처럼 분석합니다.

Nonparametric

순위 기반 결과도 위치·분포 질문과 가정을 확인합니다.

Assuming equal variancesAssuming unequal variances는 같은 결과의 장식이 아닙니다. 어떤 SE와 자유도를 썼는지 드러냅니다. Matched Pairs는 행의 연결이 이미 올바르게 정의되어야 의미가 있습니다. 프로그램은 well ID가 donor ID인지 알 수 없습니다.

분석 선택을 질문 순서로 정리합니다

  1. 반응은 연속형이며 평균 차이가 연구 질문인가?
  2. 독립 실험단위는 무엇이고 각 행은 그 단위를 나타내는가?
  3. 두 값이 설계상 대응되는가?
  4. 분포 모양, 이상값, 검열과 산포 불균형은 어떤가?
  5. 사전 분석법과 민감도 분석은 무엇인가?
  6. 효과, CI와 단위를 어떻게 보고할 것인가?

결과 문장 예시

서로 다른 donor에서 얻은 A(n=18)와 B(n=17)를 독립 비교했다. 평균 차이 B−A는 1.7 percentage points였고 Welch 95% CI는 0.2–3.2, t(29.4)=2.31, p=.028이었다. donor별 한 값을 분석단위로 사용했으며, 분포 그림과 강건 위치 추정에서도 방향은 같았다.

대응 설계라면 “완전한 쌍 n”, 평균 쌍별 차이와 차이 SD를 적습니다. 단순히 “두 그룹 t-test”라고 쓰지 마십시오.

단원을 마치며

  • 독립과 대응은 설계가 정하는 관계다.
  • Welch는 집단별 분산과 n을 따로 반영한다.
  • pooled/Welch를 산포 사전검정 하나로 자동 분기하지 않는다.
  • 대응 분석의 자료는 쌍별 차이다.
  • rank test는 가정 없는 평균 검정이 아니다.
  • 기술반복을 독립 실험단위로 세지 않는다.
독립과 대응은 계산 옵션이 아니라 데이터가 만들어진 구조입니다. 구조를 먼저 고르고, 분산·분포·이상값에 맞는 비교를 해석하십시오.

다음 단원에서는 두 집단을 세 집단 이상으로 확장합니다. 반복 t-test가 만드는 다중 오류를 ANOVA의 변동 분해로 해결합니다.

공식 보충 자료

이 글의 수치·그림·Lab은 교육용 합성 자료입니다.

💬 질문과 댓글

0개의 댓글

로그인 없이 작성할 수 있습니다. 비로그인 댓글은 작성 후 직접 수정·삭제할 수 없습니다.

0/2000

로딩 중...