효과크기·불확실성·p-value
이 토픽을 마치면
효과의 크기와 방향, 추정의 불확실성, p-value가 서로 다른 정보를 제공한다는 점을 설명할 수 있습니다. p-value를 귀무가설이 참일 확률이나 생물학적 중요성의 척도로 해석하지 않고, 연구 질문과 결과를 함께 보고하는 구조를 만들 수 있습니다.
하나의 비교에 세 가지 질문이 있다
두 조건의 outcome을 비교한다고 하겠습니다. 최소한 다음 세 질문을 분리해야 합니다.
- 관찰된 차이는 어느 방향이며 얼마나 큰가?
- 표본 변동을 고려할 때 그 차이의 불확실성은 어느 정도인가?
- 특정 귀무모형 아래에서 현재 또는 더 극단적인 자료가 얼마나 드문가?
첫 번째는 효과크기, 두 번째는 구간·표준오차, 세 번째는 p-value와 연결됩니다. 같은 연구에서 모두 필요할 수 있지만, 하나가 다른 둘을 대신하지는 않습니다.
효과크기: 차이를 질문의 단위로 말하기
효과크기는 관찰된 차이의 크기와 방향을 표현합니다. 평균 차이라면 outcome의 원래 단위로 해석할 수 있고, 비율·비율비·표준화 차이처럼 다른 척도를 선택할 수도 있습니다. 어떤 척도가 적절한지는 연구 질문과 측정 단위에 달려 있습니다.
효과크기가 크다는 말만으로 중요한 결과라고 할 수 없습니다. 실제 생물학적 판단에 필요한 최소 차이, 측정 오차, 비용과 위험, 연구설계의 타당성을 함께 알아야 합니다.
불확실성: 효과가 얼마나 흔들리는가
같은 절차로 표본을 다시 얻으면 효과크기 추정값이 달라질 수 있습니다. 표준오차, 신뢰구간, bootstrap 구간은 이 변동을 표현하는 방법입니다. 넓은 구간은 자료가 효과의 크기를 정밀하게 고정하지 못한다는 신호일 수 있지만, 그 원인을 표본 수 하나로만 설명하지 않습니다.
구간을 보고할 때는 효과의 척도, 분석 단위, 구간을 만든 절차를 함께 적습니다. 원래 단위의 차이와 표준화된 차이를 섞어 비교하지 않습니다.
p-value: 귀무모형 아래의 자료의 극단성
p-value는 특정 귀무가설과 분석 절차가 맞다는 조건에서, 관찰된 결과만큼 또는 그보다 더 극단적인 결과가 나타나는 정도를 나타냅니다. 귀무가설이 참일 확률도 아니고, 대립가설이 참일 확률도 아닙니다.
p-value가 작다는 사실은 귀무모형과 자료의 관계를 설명하는 정보입니다. 효과가 크다는 뜻, 재현된다는 뜻, 생물학적으로 중요하다는 뜻, 인과가 증명됐다는 뜻으로 자동 번역하지 않습니다. 반대로 p-value가 크다고 효과가 없다고 확정하지도 않습니다.
결과를 한 문장에 묶기
결과 보고의 기본 구조는 다음과 같습니다.
조건 B와 A의 추정 효과는 [척도와 방향]이었다.
불확실성은 [구간 또는 표준오차]로 표현했다.
사전 정의한 귀무모형 아래 p-value는 [값]이었다.
이 결과는 [설계·측정·외삽]의 범위에서만 해석한다.실제 숫자를 넣을 때는 실행 결과와 분석 단위를 확인합니다. p-value만 남기면 독자는 효과의 크기와 정밀도를 알 수 없습니다.
서로 다른 결과가 동시에 나올 수 있다
효과크기가 작아도 표본 변동이 작으면 p-value가 작게 나올 수 있고, 효과가 꽤 커 보여도 자료의 변동이 크면 구간이 넓고 p-value가 클 수 있습니다. 이 조합은 서로 모순되지 않습니다. 각각 다른 질문에 답하기 때문입니다.
예를 들어 평균 차이가 원래 단위로는 작아도 연구 목적의 최소 중요 차이를 넘을 수 있고, 반대로 통계적으로 구분되어도 실제 측정 오차나 후속 의사결정에서 의미가 작을 수 있습니다. 이런 판단을 하려면 연구 전에 중요성 기준과 측정 단위를 정해 두어야 합니다.
결과 표는 최소한 estimate, uncertainty, p_value, analysis_unit, method, interpretation_limit 열을 갖도록 설계합니다. 한 열의 별표나 색상만으로 결과의 서열을 만들지 않습니다.
사전 가설과 분석 범위
p-value의 해석은 어떤 귀무가설과 방향, 분석 절차를 사전에 정했는지에 의존합니다. 데이터를 본 뒤 outcome·subset·비교 방향을 바꾸고 같은 p-value를 확인적 결과처럼 보고하지 않습니다. 탐색적으로 발견한 비교라면 탐색 단계임을 기록하고, 후속 확인이 필요한 질문으로 돌립니다.
연구 질문으로 돌아가 해석하기
연구자가 관심 있는 것은 대개 “차이가 0인가?”보다 “얼마나 다르고, 그 차이가 연구 목적에 의미가 있는가?”입니다. 효과크기와 불확실성이 이 질문에 더 직접적으로 연결됩니다. p-value는 귀무모형과의 관계를 추가로 보여주지만, 연구 목적의 중요성 기준을 제공하지 않습니다.
연구자가 결과표에서 확인할 행
각 비교는 다음 네 층으로 읽습니다. 먼저 estimate의 방향과 단위를 확인합니다. 다음으로 구간 또는 표준오차가 어느 정도인지 봅니다. 그 뒤 p-value가 어떤 귀무모형과 절차에서 계산됐는지 확인합니다. 마지막으로 관측 단위와 외삽 범위를 읽습니다.
이 순서를 지키면 “유의함”이라는 한 단어가 결과 전체를 덮는 것을 막을 수 있습니다. 예를 들어 p-value가 작더라도 구간이 연구에서 중요한 최소 차이보다 대부분 작다면 실질적 판단은 달라질 수 있습니다. 반대로 구간이 넓다면 효과의 방향과 크기를 더 관찰해야 할 수 있습니다.
효과크기 기준은 분야와 측정 단위마다 달라집니다. 외부에서 가져온 임계값을 생물학적 중요성의 보편 기준처럼 적용하지 않고, 연구 질문과 사전 계획의 근거를 기록합니다.
자주 생기는 실패와 점검법
- p-value를 가설이 참일 확률로 쓰지 않습니다.
- 유의성 여부만 보고 효과크기와 구간을 생략하지 않습니다.
- 작은 p-value를 생물학적 중요성이나 인과로 확정하지 않습니다.
- 큰 p-value를 효과 없음의 증명으로 쓰지 않습니다.
- 사후에 정한 threshold를 사전 가설처럼 쓰지 않습니다.
핵심 정리
- 효과크기는 차이의 크기와 방향을 말합니다.
- 불확실성은 표본 변동을 표현합니다.
- p-value는 특정 귀무모형 아래 자료의 극단성을 말합니다.
- 세 정보는 서로 대체되지 않습니다.
- 해석은 연구설계와 생물학적 중요성의 범위에서 제한해야 합니다.
다음 토픽으로
다음 편에서는 두 집단, 대응 자료, 비모수 비교를 설계와 분석 단위에 맞춰 선택합니다.
참고 자료
- ASA p-value statement: https://www.amstat.org/asa/files/pdfs/p-valuestatement.pdf
- SciPy statistics reference: https://docs.scipy.org/doc/scipy/reference/stats.html
본 편의 보고 문장과 예시는 BioStatPy가 독립적으로 작성한 교육용 구성입니다.