“샘플은 3개면 되나요, 30개여야 하나요?” 이 질문에는 실험 종류만으로 정해지는 마법의 답이 없습니다. 어떤 효과를 놓치지 않으려는지, 값이 얼마나 흔들리는지, 어떤 오류를 감수할지 알아야 합니다.
이번 단원의 질문은 하나입니다.
원하는 결론을 낼 정보량을 실험 전에 어떻게 계획하는가?
네 수량은 하나의 관계로 묶입니다
평균 비교의 단순 계획에서 핵심은 다음입니다.
- 효과
Δ: 검출하고 싶은 최소한의 실질 차이 - 산포
σ: 독립 실험단위의 예상 SD - 유의수준
α: H0가 참일 때 감수할 제1종오류 - 검정력
1−β: 특정 Δ가 참일 때 검출할 확률
이 중 세 가지와 분석 구조를 정하면 필요한 n을 계산할 수 있습니다. 효과가 작고 산포가 클수록 신호대잡음비 Δ/σ가 작아져 더 많은 n이 필요합니다. α를 더 엄격하게 낮추거나 목표 power를 높여도 n이 증가합니다.
두 독립 집단의 동일 배분과 알려진 σ를 가정한 정규 근사에서는 집단당 n이 대략 (σ/Δ)²에 비례합니다. Δ를 절반으로 줄이면 n은 약 네 배가 됩니다. 이것이 “조금 더 작은 차이도 보고 싶다”가 큰 비용을 만드는 이유입니다.
최소검출차이는 과거 표본의 관측 차이가 아닙니다
계획 Δ는 연구상 놓치면 안 되는 최소 효과입니다. 파일럿에서 우연히 크게 나온 차이를 그대로 넣으면 n이 과소계획될 수 있습니다. 선행연구, 공정 허용량, 임상적 중요성, 측정 단위와 의사결정 비용으로 정당화합니다.
σ도 불확실합니다. 작은 파일럿 SD는 크게 흔들리고 선택된 조건에서 축소될 수 있습니다. 보수적 상한, 외부 자료, blinded internal pilot 또는 민감도 표를 사용해 여러 σ에서 n을 제시하는 편이 좋습니다.
같은 데이터의 관측 효과를 넣어 계산한 post hoc power는 p-value와 거의 같은 정보를 다시 표현합니다. 비유의 결과를 설명하려면 사전 계획, CI 폭, 검출 가능한 효과와 실제 정보량을 보고하십시오.
power는 효과마다 다른 곡선입니다
표본크기 하나에 검정력 하나가 붙는 것이 아닙니다. 효과가 0이면 올바른 α 수준 검정의 기각률은 α 근처이고, 효과가 커질수록 power가 상승합니다. 따라서 power curve는 “이 n에서 어떤 효과를 얼마나 잘 찾는가”를 보여줍니다.
단측검정은 사전 방향에서 더 높은 power를 가질 수 있지만 반대 방향을 검정하지 않습니다. 데이터 뒤에 단측으로 바꿔 n을 줄이거나 p값을 낮추는 것은 허용되지 않습니다.
In-Silico Lab: 계획 n의 민감도를 봅니다
Lab은 두 독립 집단, 양측 α=.05, 동일 n, 알려진 공통 SD의 정규 근사를 사용합니다.
- Δ=2에서 Δ=.5로 줄여 집단당 n이 얼마나 증가하는지 봅니다.
- SD를 2에서 4로 높여 n의 제곱 관계를 확인합니다.
- power 80%, 90%, 95%의 비용을 비교합니다.
- 계산값을 실제 연구 n으로 확정하기 전에 빠진 설계 요소를 적습니다.
효과·산포·검정력으로 독립 n을 계획하세요
두 독립 집단, 양측 α=.05, 동일 배분의 정규 근사를 투명하게 계산합니다. 이것은 시작값이지 모든 설계를 대신하는 답이 아닙니다.
같은 설정의 합성 관측
계산 결과
탈락률을 더하는 것과 군집·반복측정의 설계효과를 반영하는 것은 별도 단계입니다. 사후 관측효과로 power를 재계산해 p값을 반복 설명하지 마십시오.
교육용 synthetic model · bjs-comparison-sequence-v1. 실제 연구 판단에는 실험단위, 결측, 분포, 다중성, 사전계획과 도메인 기준을 별도로 반영해야 합니다.
현실의 표본수는 단순 공식보다 큽니다
다음은 별도 보정·시뮬레이션·전문 모형이 필요할 수 있습니다.
- 예상 탈락, 분석 제외와 측정 실패
- 불균형 배분과 비용 차이
- donor 안 well, 기관 안 환자 같은 군집 설계효과
- 반복측정 상관과 paired SD
- 여러 endpoint·중간분석·다중비교
- 비열등성·동등성·생존·비율 등 다른 estimand
- 정수 block size와 최소 batch 수
탈락률 10%를 단순히 n×1.10으로 계산하기보다 n/(1−0.10)처럼 남아야 할 분석 n을 기준으로 올립니다. 군집자료는 개체 수와 cluster 수 모두가 중요하며 well만 늘려 donor 정보를 대체할 수 없습니다.
JMP 출력에서는 입력 가정이 결과의 일부입니다
효과·SD·α·검정력 중 알고 있는 값을 바탕으로 나머지를 계산합니다.
효과가 달라질 때 검출확률이 연속적으로 바뀌는 모습을 봅니다.
독립 n, 검정방향, 배분비와 분석법이 계획과 일치해야 합니다.
결과 스크린샷만 보관하지 말고 분석법, 양측/단측, Δ, SD, α, power, 배분비, 계산한 n의 단위와 소프트웨어 버전을 기록합니다. 반올림은 일반적으로 올림하고 block 또는 pair 구조를 만족하도록 조정합니다.
계획 문장 예시
주요 endpoint는 day 7 viability의 donor 평균 차이였다. 최소검출차이 5 percentage points, donor 간 SD 8, 양측 α=.05, power 90%, 1:1 배분으로 집단당 55 donor를 계획했다. 10% 분석 불가를 고려해 집단당 62 donor를 모집한다. well 기술반복은 측정 정밀도를 위해 사용하되 독립 n에 포함하지 않는다.
단원을 마치며
- 충분한 n은 효과·산포·α·power·분석 구조의 함수다.
- Δ는 과학적으로 놓치면 안 되는 사전 효과다.
- σ의 불확실성을 민감도 분석에 반영한다.
- power는 효과에 따른 곡선이다.
- 관측효과 기반 사후 power로 결과를 재해석하지 않는다.
- 탈락·군집·반복·다중성을 현실 계획에 추가한다.
다음 단원부터는 집단 차이에서 두 연속변수의 관계로 이동합니다. 상관계수보다 산점도를 먼저 읽습니다.
공식 보충 자료
이 Lab의 n은 교육용 정규 근사입니다. 실제 연구계획은 설계와 규정에 맞게 검토해야 합니다.