목록으로

차이가 없다는 것과 동등하다는 것: TOST와 동등성 한계

차이검정의 비유의가 동등성을 뜻하지 않는 이유와 사전 동등성 한계, 두 단측 검정, 90% CI의 판정 구조를 설명한다.

중급
|
28
|
검증 완료 (2026-08-14)
동등성TOST동등성 한계90% 신뢰구간비열등성JMP
진행률0/19 (0%)

A와 B의 평균 차이검정 p=.24가 나왔습니다. “유의한 차이가 없으므로 두 조건은 같다”고 써도 될까요? 아닙니다. 작은 표본과 큰 산포에서는 큰 차이가 있어도 검출하지 못할 수 있습니다.

이번 단원의 질문은 하나입니다.


두 조건이 충분히 비슷하다는 적극적 증거는 어떻게 구성하는가?
동등성 한계 Δ실질적으로 허용할 차이의 사전 경계
TOST두 단측 귀무가설을 모두 기각하는 절차
90% CIα=.05 TOST와 대응하는 차이 구간
불확정차이도 동등성도 입증하기 부족한 결과

차이검정과 동등성검정은 귀무가설이 반대입니다

차이검정은 H0: 차이=0에서 출발해 차이가 있다는 증거를 찾습니다. 기각하지 못하면 0과 양립한다는 뜻이지 작은 차이 범위 안에 있다고 입증한 것이 아닙니다.

동등성검정은 실질적으로 무시할 수 있는 경계 −Δ를 먼저 정합니다. 평균 차이를 δ=μB−μA라 하면:

  • H0: δ≤−Δ 또는 δ≥+Δ — 차이가 허용범위 밖이다.
  • H1: −Δ<δ<+Δ — 차이가 허용범위 안이다.
U12 · Figure 01
차이검정과 동등성검정은 귀무가설의 방향이 반대입니다
−Δ허용 영역CI 밖CI 전체 안동등성
TOST에서는 차이가 −Δ 이하이거나 +Δ 이상이라는 두 귀무가설을 모두 기각해야 합니다.

TOST는 아래 두 귀무가설을 각각 단측 α로 검정합니다.

  1. B가 A보다 Δ 이상 낮다는 H0를 기각한다.
  2. B가 A보다 Δ 이상 높다는 H0를 기각한다.

둘 다 기각해야 동등성 근거가 생깁니다. 하나라도 실패하면 결과는 비동등 확정일 수도, 단지 불확정일 수도 있습니다.

α=.05 TOST와 90% CI가 대응합니다

일반적으로 두 단측 검정의 유의수준이 α이면 차이의 (1−2α)×100% 양측 CI가 동등성 한계 안에 완전히 들어오는지로 같은 판단을 할 수 있습니다. α=.05이면 90% CI입니다.

  • CI 전체가 −Δ 안: 동등성 근거
  • CI가 경계를 넘지만 0 포함: 차이도 동등성도 확정 못한 불확정
  • CI가 0에서 멀고 경계 밖: 의미 있는 차이 가능성

95% CI를 관습적으로 쓰고 TOST p값과 뒤섞지 마십시오. 추정용 95% CI를 함께 제시할 수 있지만 어느 CI가 어떤 판단에 대응하는지 명확히 씁니다.

Δ는 데이터로 편리하게 고르는 숫자가 아닙니다

관측 CI가 들어오도록 한계를 넓히면 질문을 사후 변경한 것입니다. Δ는 과학적·임상적·품질적 영향, 측정 신뢰성과 선행 근거를 바탕으로 데이터 전에 정당화해야 합니다. 규제 영역은 해당 가이드와 전문 검토가 별도로 필요합니다.

작은 p-value 두 개보다 CI 그림이 먼저입니다

TOST 출력에는 lower test와 upper test p-value가 각각 있습니다. 가장 큰 p-value가 α보다 작아야 두 조건을 모두 통과합니다. 그러나 CI와 한계를 같은 축에 그리면 어떤 경계가 실패했는지, 효과가 어느 방향인지 더 직접 보입니다.

동등성은 공정 전체의 동일성, 개별 제품의 규격 적합, 분산의 동일성이나 상호교환성을 자동 보증하지 않습니다. 어떤 endpoint, population, 시간창과 효과 척도에 대한 동등성인지 제한해서 말합니다.

In-Silico Lab: 같은 참차이도 n에 따라 결론이 달라집니다

  1. 실제 차이 0, Δ=1에서 n=8과 n=100을 비교합니다.
  2. n이 작을 때 차이검정도 동등성검정도 결론내리지 못하는 영역을 봅니다.
  3. 실제 차이를 1.5로 올려 CI 중심이 한계 밖으로 이동하는지 봅니다.
  4. 데이터를 그대로 두고 Δ를 넓히는 것이 왜 과학적 증거를 추가하지 않는지 설명합니다.
In-Silico Lab · U12

CI 전체가 동등성 한계 안에 들어오는지 보세요

α=.05 TOST와 대응하는 90% CI를 사용해 차이·동등·불확정 질문이 왜 다른지 확인합니다.

같은 설정의 합성 관측

−Δ · 90% CI · +Δ

계산 결과

추정 차이1.67
90% CI0.94–2.41
동등성 한계±1.0
판정동등성 근거 부족

CI가 한계와 겹치는 것만으로는 부족합니다. 전체 구간이 안에 있어야 두 단측 귀무가설을 모두 기각합니다.

교육용 synthetic model · bjs-comparison-sequence-v1. 실제 연구 판단에는 실험단위, 결측, 분포, 다중성, 사전계획과 도메인 기준을 별도로 반영해야 합니다.

Lab은 알려진 σ의 교육용 한 표본 차이 모형입니다. 실제 두 표본·대응·비율·로그 변환 endpoint에는 설계에 맞는 SE와 CI를 사용합니다.

JMP는 한계와 CI를 표시하지만 한계를 정당화하지 않습니다

Equivalence Test

차이 CI와 사전 동등성 한계를 같은 축에서 봅니다.

Lower / Upper Test

두 단측 검정이 모두 기준을 넘었는지 확인합니다.

Practical Difference

통계 프로그램이 한계의 과학적 타당성을 정해주지는 않습니다.

과거 강의의 사료·바이오시밀러 예제와 규제 한계는 공개 정답으로 재사용하지 않습니다. 현재 글은 합성 공정 차이를 사용하며, JMP의 역할은 Practical Difference, 차이 추정, 두 단측 결과와 CI의 관계를 표현하는 데 한정합니다.

결과 문장 예시

사전에 정한 동등성 한계는 평균 활성 차이 ±2.0 percentage points였다. 독립 batch 차이 B−A는 0.4였고 α=.05 TOST 대응 90% CI는 −1.1–1.9로 한계 안에 완전히 포함됐다. 두 단측 검정은 모두 기각되어 이 endpoint와 분석집단에서 동등성 근거가 있었다. 이 결과는 개별 batch 규격 적합이나 다른 품질특성의 동등성을 뜻하지 않는다.

동등성 근거가 부족할 때 “비동등하다”로 자동 바꾸지 말고 CI 위치에 따라 불확정과 명백한 한계 초과를 구분합니다.

단원을 마치며

  • 차이검정 비유의는 동등성 증명이 아니다.
  • 동등성 H0는 차이가 한계 밖이라는 방향이다.
  • TOST는 두 단측 H0를 모두 기각해야 한다.
  • α=.05 TOST는 90% CI 전체가 한계 안인지와 대응한다.
  • Δ는 데이터 전에 도메인 근거로 정당화한다.
  • endpoint와 범위를 제한해 결론을 쓴다.
유의하지 않음은 동등성의 증거가 아닙니다. 사전에 정당화한 Δ 안에 전체 CI가 들어와야 “충분히 비슷하다”는 질문에 답할 수 있습니다.

다음 단원에서는 동등성처럼 적극적 결론을 내릴 충분한 정밀도를 설계하기 위해 효과·산포·α·검정력과 표본크기를 연결합니다.

공식 보충 자료

이 글은 동등성 원리를 설명하는 교육 자료이며 규제·임상 설계를 승인하지 않습니다.

💬 질문과 댓글

0개의 댓글

로그인 없이 작성할 수 있습니다. 비로그인 댓글은 작성 후 직접 수정·삭제할 수 없습니다.

0/2000

로딩 중...