상관계수는 두 변수가 같이 움직이는 정도를 요약하지만 “X가 1단위 변할 때 평균 Y가 얼마나 달라지는가”는 직접 말하지 않습니다. 회귀는 이 질문을 식으로 표현합니다.
이번 단원의 질문은 하나입니다.
직선 하나는 관계를 얼마나 잘 설명하며, 어디서 실패하는가?
단순선형회귀는 평균 관계를 두 계수로 압축합니다
Yᵢ=β₀+β₁Xᵢ+εᵢ
- β₀ 절편: X=0일 때 평균 Y
- β₁ 기울기: X가 1단위 증가할 때 평균 Y의 변화
- εᵢ 오차: 식이 설명하지 못하는 개별 변동
표본에서는 ŷᵢ=b₀+b₁xᵢ를 적합합니다. 기울기의 단위는 Y 단위/X 단위입니다. X=농도 mg/mL, Y=viability percentage point라면 그 단위를 그대로 써야 과학적 의미가 생깁니다.
절편은 X=0이 관측 범위 밖이면 계산에는 필요해도 실질 해석이 없을 수 있습니다. X를 연구상 의미 있는 중심값에서 빼면 절편을 관측 범위의 평균 반응으로 바꿀 수 있습니다.
최소제곱은 수직 잔차의 제곱합을 최소화합니다
잔차는 eᵢ=yᵢ−ŷᵢ입니다. 최소제곱은 Σeᵢ²가 가장 작은 직선을 고릅니다. 제곱 때문에 큰 잔차가 큰 영향력을 가집니다. 따라서 이상값의 측정 원인과 영향력을 반드시 확인합니다.
잔차가 양수면 관측값이 예측보다 높고, 음수면 낮습니다. 잘 맞는 선형모형의 잔차는 예측값과 실행순서에 대해 특별한 구조 없이 0 주변에 흩어져야 합니다.
R²는 설명 비율이지 품질 보증서가 아닙니다
R²=1−SSE/SST
R²는 관측 Y의 총변동 중 적합식이 표본 안에서 설명한 비율입니다. 단순 회귀에서는 r²와 같습니다. 그러나 높은 R²도 다음을 보증하지 않습니다.
- 직선 함수형이 맞다.
- 잔차분산이 일정하다.
- 오차가 독립이다.
- 중요한 변수가 빠지지 않았다.
- 관계가 인과적이다.
- 새 데이터 예측이 좋다.
X 범위를 넓히면 R²가 높아질 수 있고 좁히면 낮아질 수 있습니다. 반응 변동이 본질적으로 작은 분야에서는 낮은 R²도 유용한 평균 효과를 가질 수 있습니다.
예측값 대 잔차 그림의 곡선, 깔때기, 시간 추세, 군집과 극단점을 확인하십시오. 숫자 요약 하나는 구조적 모형 실패를 가릴 수 있습니다.
네 가지 잔차 패턴은 서로 다른 문제를 말합니다
- U자·S자: 선형식에 곡률이나 변환이 필요할 수 있음
- 깔때기: 평균 수준에 따라 분산이 변함
- 실행순서 추세: drift, autocorrelation, batch 변화
- 고립된 큰 잔차: 측정오류, 다른 모집단, 영향점
수정은 잔차 모양만 보고 가장 유리한 다항차수를 계속 추가하는 것이 아닙니다. 기전과 설계 범위, 사전 후보 모형을 바탕으로 항을 정하고 새로운 데이터나 교차검증으로 확인합니다.
반복된 X 수준이 있으면 pure error와 lack of fit을 분리할 수 있습니다. lack-of-fit 검정은 후보 함수가 반복 오차보다 큰 체계적 실패를 보이는지 돕지만, 비유의라고 모형이 참이라는 뜻은 아닙니다.
외삽은 직선을 더 멀리 긋는 행위가 아닙니다
관측 X가 1–5인데 X=20에서 예측하면 반응 기전, 포화, 독성이나 물리적 경계가 달라질 수 있습니다. 회귀식의 대수적 값은 계산되지만 근거는 설계 범위 안에 있습니다. 예측구간은 모형이 맞다는 조건 아래의 불확실성이지 외삽을 정당화하지 않습니다.
In-Silico Lab: 모형을 일부러 실패시킵니다
- 곡률 0에서 적합 직선과 R²를 봅니다.
- 곡률을 1.2, 2로 올리고 R²와 잔차 구조를 비교합니다.
- 이상값 한 점을 추가해 기울기와 SSE가 바뀌는지 봅니다.
- seed를 바꿔 표본 적합이 생성모형을 얼마나 흔들리게 추정하는지 확인합니다.
직선과 잔차를 동시에 진단하세요
직선 적합 뒤 R²와 잔차가 곡률·이상값을 서로 다르게 드러내는지 봅니다.
같은 설정의 합성 관측
계산 결과
높은 R²도 잔차의 곡선 패턴을 지우지 못합니다. 측정 범위 밖 외삽은 특히 금지합니다.
교육용 synthetic model · bjs-relationship-sequence-v1. 실제 연구 판단에는 실험단위, 결측, 분포, 다중성, 사전계획과 도메인 기준을 별도로 반영해야 합니다.
JMP 결과는 계수표에서 잔차로 이동합니다
절편·기울기 추정과 SE·CI를 실제 단위에서 읽습니다.
R²는 설명 비율이지 모형 적합성의 단독 증명이 아닙니다.
곡률·이분산·시간 drift·이상값 구조를 찾습니다.
Parameter Estimates의 계수·SE·CI, Summary of Fit의 R²와 RMSE, Analysis of Variance의 model test를 읽은 뒤 반드시 residual plot과 actual by predicted를 봅니다. Polynomial 항은 메뉴에서 쉽게 추가된다는 이유가 아니라 과학적 후보와 진단에 따라 사용합니다.
결과 문장 예시
독립 batch 38개에서 농도 1–5 mg/mL 범위의 선형모형을 적합했다. 기울기는 2.4 percentage points/(mg/mL), 95% CI 1.6–3.2였고 R²=.48이었다. 잔차-예측 그림에는 뚜렷한 곡률이 없었으나 고농도에서 분산이 증가했다. 가중 모형 민감도 분석에서도 기울기 방향은 유지됐다. 이 식을 측정 범위 밖으로 외삽하지 않았다.
단원을 마치며
- 기울기는 X 1단위 변화에 따른 평균 Y 변화다.
- 최소제곱은 수직 잔차 제곱합을 최소화한다.
- R²는 설명 비율이며 모형 적합성의 단독 기준이 아니다.
- 잔차는 곡률·이분산·drift·이상값을 드러낸다.
- 다항항은 사후 p값 경쟁이 아니라 기전과 검증으로 선택한다.
- 예측 근거는 관측·설계 범위 안에 있다.
다음 단원부터는 관찰된 X–Y 관계를 넘어, 여러 입력을 의도적으로 배치하는 실험계획법으로 들어갑니다.
공식 보충 자료
이 글의 모형과 Lab은 교육용 합성 자료입니다.