공정 A와 B의 평균 수율이 모두 82라고 합시다. A는 대부분 80–84에 모이지만 B는 70–94까지 넓게 흔들립니다. 평균만 보면 두 공정은 같아 보이지만, 다음 batch의 예측 가능성과 평균 차이의 표준오차는 전혀 같지 않습니다.
이번 단원의 질문은 하나입니다.
두 집단의 퍼짐이 다르면 평균 비교의 불확실성은 어떻게 달라지는가?
산포는 평균 비교의 배경 잡음입니다
두 평균의 관측 차이는 각 집단 안의 자연 변동과 비교해야 합니다. 값들이 촘촘하면 작은 평균 차이도 선명할 수 있고, 넓게 퍼지면 같은 차이도 표집변동에 묻힐 수 있습니다. 두 집단의 모집단 분산이 같다고 놓는 조건을 등분산, 다르다고 놓는 조건을 이분산이라 합니다.
등분산은 표본 SD 두 개가 똑같아야 한다는 말이 아닙니다. 같은 모집단 분산에서 뽑아도 표본 SD는 매번 달라집니다. 반대로 두 SD가 우연히 비슷해도 분포 모양이나 표본크기 차이 때문에 평균 비교의 불확실성이 같다고 보장되지 않습니다.
먼저 각 집단의 dot plot, box plot과 SD를 나란히 보십시오. 넓어진 이유가 전체적인 scale 변화인지, 한두 이상값인지, 오른쪽 꼬리인지, 서로 다른 하위집단의 혼합인지 구분해야 합니다. 분산 검정은 이 그림을 대신하지 않습니다.
산포 검정들은 같은 질문을 같은 방식으로 묻지 않습니다
공통 귀무가설은 대체로 H0: σ₁²=σ₂²=…=σk²입니다. 그러나 검정통계량이 산포를 재는 방식과 분포 가정이 다릅니다.
- 두 집단 F test는 표본분산의 비를 F 분포와 비교합니다. 정규모형에 민감합니다.
- Bartlett test는 여러 집단에 효율적일 수 있지만 비정규성과 이상값에 민감합니다.
- Levene test는 각 관측값이 집단 중심에서 떨어진 절대거리를 새 반응처럼 비교합니다.
- 중심을 평균 대신 median으로 두는 Levene 변형을 흔히 Brown–Forsythe 방식이라 부르며, 꼬리와 이상값에 더 강건한 선택이 될 수 있습니다.
검정 이름을 암기하는 대신 어떤 중심과 거리를 쓰는지, 정규성 이탈에 얼마나 민감한지 물으십시오.
산포 검정이 유의하지 않다는 것은 현재 표본에서 분산 차이를 탐지할 증거가 부족하다는 뜻입니다. 작은 n에서는 큰 분산비도 놓칠 수 있습니다. ‘같다’고 채택하거나 pooled t-test를 자동 허가하는 신호로 쓰지 마십시오.
사전검정 하나로 평균 검정을 갈라서는 안 됩니다
과거의 흔한 절차는 먼저 등분산 검정을 하고, 유의하면 Welch t-test, 유의하지 않으면 pooled t-test를 선택하는 것이었습니다. 이 이단계 자동분기는 최종 오류율과 불확실성을 복잡하게 만들고 작은 표본에서 불안정합니다.
분석 선택은 자료를 보기 전에 설계와 과학적 가정으로 정하는 편이 좋습니다. 두 독립 집단의 평균 비교에서 Welch 방법은 집단별 분산과 n을 따로 반영하므로 등분산이 확실하지 않은 상황에서 유용한 강건 대안입니다. 그렇다고 모든 설계에서 유일한 방법이라는 뜻은 아닙니다. 대응·군집·반복측정·검열 자료에는 구조에 맞는 모형이 필요합니다.
In-Silico Lab: 평균을 그대로 두고 폭만 바꿉니다
아래 Lab에서 두 집단의 참평균은 같습니다. B의 SD 비율과 n, seed만 바꾸십시오.
- SD 비를 1에서 3으로 올려 표본 SD 비가 매번 정확히 설정값과 같지 않음을 봅니다.
- n=8과 n=40에서 새 표본을 반복해 산포 추정의 흔들림을 비교합니다.
- SD와 median absolute deviation이 같은 방향으로 움직이지 않는 표본을 찾습니다.
- 평균이 같다는 사실이 안정성이 같다는 뜻인지 다시 답합니다.
평균을 고정하고 산포만 바꾸어 보세요
같은 평균을 가진 두 집단에서 B의 SD 비율을 바꾸며 표본 SD와 robust distance가 어떻게 움직이는지 봅니다.
같은 설정의 합성 관측
계산 결과
표본 산포 차이는 자료가 만드는 증거입니다. p값 하나로 두 모집단 분산이 같다고 증명할 수 없습니다.
교육용 synthetic model · bjs-comparison-sequence-v1. 실제 연구 판단에는 실험단위, 결측, 분포, 다중성, 사전계획과 도메인 기준을 별도로 반영해야 합니다.
Lab은 산포 검정 p-value를 경쟁시키지 않습니다. 먼저 어떤 데이터 생성 조건이 어떤 산포 요약을 바꾸는지를 보게 합니다. 실제 자료에서는 원자료 그림, 표본크기, 이상값의 원인, 측정 상한·하한과 독립성을 함께 검토해야 합니다.
JMP 출력은 여러 민감도를 나란히 보여주는 역할입니다
F·Levene·Brown-Forsythe류 결과는 같은 산포 질문을 서로 다른 민감도로 봅니다.
표본 SD의 크기와 불확실성을 그림으로 먼저 확인합니다.
p값 하나가 아니라 분포 모양·n·이상값과 함께 판단합니다.
JMP의 과거 메뉴 경로를 따라 하는 것이 목표가 아닙니다. 결과에서 각 검정이 같은 H0를 어떤 방식으로 조사하는지, Std Dev와 신뢰구간이 실제 규모를 얼마나 보여주는지 읽으십시오. 여러 p-value 중 가장 유리한 하나를 골라 결론내리면 안 됩니다.
보고 문장은 산포와 평균 질문을 분리합니다
나쁜 문장:
Levene p=.31이므로 두 분산은 같고 pooled t-test를 사용했다.
더 나은 문장:
독립 batch의 표본 SD는 A 1.8, B 3.1이었다. B에서 더 넓은 산포와 오른쪽 꼬리가 관찰됐다. 평균 차이는 사전 지정 Welch 방법으로 추정했고, 산포 비교는 원자료 그림 및 median 기반 Levene 결과와 함께 민감도 정보로 제시했다.
분산 차이 자체가 연구 질문이면 분산비나 scale 차이의 CI를 보고하십시오. 평균 비교의 가정 점검이라면 평균 효과와 CI가 중심이고 산포 검정은 보조 진단입니다.
단원을 마치며
- 등분산은 모집단 모형의 가정이지 두 표본 SD의 일치가 아니다.
- 산포 차이는 평균 차이의 표준오차와 예측 가능성을 바꾼다.
- F·Bartlett은 정규성 이탈에 민감하고 Levene류는 중심거리로 강건성을 높인다.
- 비유의 산포 검정은 분산이 같다는 증명이 아니다.
- 산포 검정 뒤 분석법을 기계적으로 바꾸지 않는다.
- 원자료 그림과 실험단위가 모든 검정보다 먼저다.
다음 단원에서는 한 집단의 평균을 외부 기준값과 비교하며 효과·표준오차·CI·p-value를 하나의 결과 문장으로 묶습니다.
공식 보충 자료
이 글의 수치·그림·Lab은 교육용 합성 자료입니다. 실제 연구·임상·품질·규제 판단의 단독 근거로 사용할 수 없습니다.