相関係数は二変数が一緒に動く程度を要約しますが、「Xが1単位変わると平均Yがどれだけ変わるか」は直接言いません。回帰はこの問いを式で表します。
この単元の問いは一つです。
一本の直線は関係をどこまで説明でき、どこで失敗するか。
単純線形回帰は平均関係を二つの係数へ圧縮します
Yᵢ=β₀+β₁Xᵢ+εᵢ
- β₀ 切片: X=0のときの平均Y
- β₁ 傾き: Xが1単位増えるときの平均Yの変化
- εᵢ 誤差: 式が説明しない個別変動
標本では ŷᵢ=b₀+b₁xᵢ を適合します。傾きの単位はY単位/X単位です。Xが濃度mg/mL、Yがviability percentage pointなら、その単位を保って初めて科学的意味を持ちます。
X=0が観測範囲外なら、切片は計算上必要でも実質的解釈を持たないことがあります。研究上意味のある中心値でXを中心化すれば、切片をその基準での平均応答にできます。
最小二乗は垂直残差の二乗和を最小化します
残差は eᵢ=yᵢ−ŷᵢ です。最小二乗は Σeᵢ² が最小の直線を選びます。二乗により大きい残差は大きな影響を持つため、外れ値の測定原因と影響力を必ず確認します。
残差が正なら観測値は予測より高く、負なら低いことを示します。適切な線形モデルの残差は、予測値とrun順に対して特別な構造なく0の周りに散るべきです。
R²は説明割合であって品質保証書ではありません
R²=1−SSE/SST
R²は観測Yの総変動のうち、標本内で適合式が説明した割合です。単純回帰ではr²と等しくなります。しかし高いR²も次を保証しません。
- 直線の関数形が正しいこと
- 残差分散が一定なこと
- 誤差が独立なこと
- 重要な変数が欠けていないこと
- 関係が因果的なこと
- 新しいデータへの予測が良いこと
X範囲を広げればR²は高くなり、狭めれば低くなり得ます。応答変動が本質的に小さい領域では、低いR²でも有用な平均効果を持ち得ます。
予測値対残差図の曲線、漏斗、時間傾向、クラスター、極端点を確認してください。一つの数値要約は構造的なモデル失敗を隠せます。
四つの残差パターンは異なる問題を示します
- U字・S字: 線形式に曲率や変換が必要かもしれません。
- 漏斗: 平均水準により分散が変わります。
- run順の傾向: drift、自己相関、batch変化です。
- 孤立した大残差: 測定誤差、別母集団、影響点です。
残差形だけを見て都合のよい多項式次数を追加し続けるのは修正ではありません。機序、設計範囲、事前の候補モデルに基づいて項を選び、新しいデータまたは交差検証で確かめます。
反復X水準があればpure errorとlack of fitを分けられます。lack-of-fit検定は候補関数が反復誤差より大きい系統的失敗を示すかを助けますが、非有意でもモデルが真という意味ではありません。
外挿は直線をさらに遠くへ引く行為ではありません
観測Xが1–5なのにX=20を予測すれば、応答機序、飽和、毒性、物理的境界が異なるかもしれません。回帰式の代数値は計算できますが、根拠は設計範囲内にあります。予測区間はモデルが正しい条件下の不確実性であり、外挿を正当化しません。
In-Silico Lab: モデルを意図的に失敗させます
- 曲率0で適合直線とR²を見ます。
- 曲率を1.2、2へ上げ、R²と残差構造を比べます。
- 外れ値一つを加え、傾きとSSEの変化を見ます。
- seedを変え、標本適合が生成モデルをどの程度揺れて推定するか確認します。
직선과 잔차를 동시에 진단하세요
직선 적합 뒤 R²와 잔차가 곡률·이상값을 서로 다르게 드러내는지 봅니다.
처음이라면: 무엇을 눌러야 하나요?
- 1. 질문을 먼저 읽기Lab 제목에서 이번에 비교할 한 가지를 확인합니다.
- 2. 조건 하나만 바꾸기처음에는 n, 효과, 산포 같은 입력 중 하나만 바꾸십시오.
- 3. 새 합성 표본 누르기새 합성 데이터가 만들어집니다. 같은 조건도 표본에 따라 달라질 수 있습니다.
- 4. 그림과 계산 결과 비교하기바꾸기 전후 무엇이 움직이고 무엇이 그대로인지 한 문장으로 적어보십시오.
막히면 초기화로 돌아가 기본 결과를 본 뒤 조건 하나만 바꾸십시오. 이 Lab은 정답 판정기가 아니라 패턴 관찰 도구입니다.
같은 설정의 합성 관측
계산 결과
높은 R²도 잔차의 곡선 패턴을 지우지 못합니다. 측정 범위 밖 외삽은 특히 금지합니다.
교육용 synthetic model · bjs-relationship-sequence-v1. 실제 연구 판단에는 실험단위, 결측, 분포, 다중성, 사전계획과 도메인 기준을 별도로 반영해야 합니다.
JMP結果は係数表から残差へ移ります
절편·기울기 추정과 SE·CI를 실제 단위에서 읽습니다.
R²는 설명 비율이지 모형 적합성의 단독 증명이 아닙니다.
곡률·이분산·시간 drift·이상값 구조를 찾습니다.
Parameter Estimatesの係数・SE・CI、Summary of FitのR²・RMSE、Analysis of Varianceのモデル検定を読んだ後、必ずresidual plotとactual by predictedを見ます。Polynomial項はメニューで簡単に追加できるからではなく、科学的候補と診断に従って使います。
結果文の例
独立batch 38件で濃度1–5 mg/mL範囲の線形モデルを適合した。傾きは2.4 percentage points/(mg/mL)、95% CI 1.6–3.2、R²=.48だった。残差対予測図に明瞭な曲率はなかったが、高濃度で分散が増加した。加重モデルの感度分析でも傾きの方向は維持された。この式を測定範囲外へ外挿しなかった。
この単元の要点
- 傾きはXの1単位変化に対する平均Y変化です。
- 最小二乗は垂直残差二乗和を最小化します。
- R²は説明割合であり、モデル適合の単独基準ではありません。
- 残差は曲率・不等分散・drift・外れ値を表します。
- 多項式項は事後p値競争でなく、機序と検証で選びます。
- 予測の根拠は観測・設計範囲内にあります。
次の単元からは観測されたX–Y関係を超え、複数入力を意図的に配置する実験計画法へ進みます。
公式補足資料
この記事のモデルとLabは教育用の合成資料です。