相関係数は二変数が一緒に動く程度を要約しますが、「Xが1単位変わると平均Yがどれだけ変わるか」は直接言いません。回帰はこの問いを式で表します。
この単元の問いは一つです。
一本の直線は関係をどこまで説明でき、どこで失敗するか。
単純線形回帰は平均関係を二つの係数へ圧縮します
Yᵢ=β₀+β₁Xᵢ+εᵢ
- β₀ 切片: X=0のときの平均Y
- β₁ 傾き: Xが1単位増えるときの平均Yの変化
- εᵢ 誤差: 式が説明しない個別変動
標本では ŷᵢ=b₀+b₁xᵢ を適合します。傾きの単位はY単位/X単位です。Xが濃度mg/mL、Yがviability percentage pointなら、その単位を保って初めて科学的意味を持ちます。
X=0が観測範囲外なら、切片は計算上必要でも実質的解釈を持たないことがあります。研究上意味のある中心値でXを中心化すれば、切片をその基準での平均応答にできます。
最小二乗は垂直残差の二乗和を最小化します
残差は eᵢ=yᵢ−ŷᵢ です。最小二乗は Σeᵢ² が最小の直線を選びます。二乗により大きい残差は大きな影響を持つため、外れ値の測定原因と影響力を必ず確認します。
残差が正なら観測値は予測より高く、負なら低いことを示します。適切な線形モデルの残差は、予測値とrun順に対して特別な構造なく0の周りに散るべきです。
R²は説明割合であって品質保証書ではありません
R²=1−SSE/SST
R²は観測Yの総変動のうち、標本内で適合式が説明した割合です。単純回帰ではr²と等しくなります。しかし高いR²も次を保証しません。
- 直線の関数形が正しいこと
- 残差分散が一定なこと
- 誤差が独立なこと
- 重要な変数が欠けていないこと
- 関係が因果的なこと
- 新しいデータへの予測が良いこと
X範囲を広げればR²は高くなり、狭めれば低くなり得ます。応答変動が本質的に小さい領域では、低いR²でも有用な平均効果を持ち得ます。
予測値対残差図の曲線、漏斗、時間傾向、クラスター、極端点を確認してください。一つの数値要約は構造的なモデル失敗を隠せます。
四つの残差パターンは異なる問題を示します
- U字・S字: 線形式に曲率や変換が必要かもしれません。
- 漏斗: 平均水準により分散が変わります。
- run順の傾向: drift、自己相関、batch変化です。
- 孤立した大残差: 測定誤差、別母集団、影響点です。
残差形だけを見て都合のよい多項式次数を追加し続けるのは修正ではありません。機序、設計範囲、事前の候補モデルに基づいて項を選び、新しいデータまたは交差検証で確かめます。
反復X水準があればpure errorとlack of fitを分けられます。lack-of-fit検定は候補関数が反復誤差より大きい系統的失敗を示すかを助けますが、非有意でもモデルが真という意味ではありません。
外挿は直線をさらに遠くへ引く行為ではありません
観測Xが1–5なのにX=20を予測すれば、応答機序、飽和、毒性、物理的境界が異なるかもしれません。回帰式の代数値は計算できますが、根拠は設計範囲内にあります。予測区間はモデルが正しい条件下の不確実性であり、外挿を正当化しません。
In-Silico Lab: モデルを意図的に失敗させます
- 曲率0で適合直線とR²を見ます。
- 曲率を1.2、2へ上げ、R²と残差構造を比べます。
- 外れ値一つを加え、傾きとSSEの変化を見ます。
- seedを変え、標本適合が生成モデルをどの程度揺れて推定するか確認します。
直線と残差を同時に診断する
直線適合後、R²と残差が曲率・異常値を互いに異なって表わすかどうかを確認します。
初めての場合:何を押すべきですか?
- 1.質問を最初に読むLabタイトルで今回比較する1つを確認してください。
- 2.条件を1つだけ変更する最初は、n、効果、散布などの入力の1つだけを変更します。
- 3. 新しい合成サンプル 押す新しい合成データが作成されます。同じ条件も標本によって変わり得る。
- 4. 図と計算結果 比較する変更の前後に何が動いて、何がそのままであるかを一文で書き留めてください。
詰まったら初期化に戻り、デフォルトの結果を見た後、条件を1つだけ置き換えます。このLabは正解判定器ではなく、パターン観察ツールです。
同じ設定の合成観測
計算結果
高いR²も残差の曲線パターンを消去しません。測定範囲外外挿は特に禁止します。
教育用 synthetic model ·bjs-relationship-sequence-v1。実際の研究判断には、実験単位、欠測、分布、多重性、事前計画とドメイン基準を別々に反映しなければなりません。
JMP結果は係数表から残差へ移ります
切片・傾き推定とSE・CIを実際の単位で読み出します。
R²は説明の比率であり、モデル適合性の単独の証明ではありません。
曲率・二分散・時間ドリフト・異常値構造を探します。
Parameter Estimatesの係数・SE・CI、Summary of FitのR²・RMSE、Analysis of Varianceのモデル検定を読んだ後、必ずresidual plotとactual by predictedを見ます。Polynomial項はメニューで簡単に追加できるからではなく、科学的候補と診断に従って使います。
結果文の例
独立batch 38件で濃度1–5 mg/mL範囲の線形モデルを適合した。傾きは2.4 percentage points/(mg/mL)、95% CI 1.6–3.2、R²=.48だった。残差対予測図に明瞭な曲率はなかったが、高濃度で分散が増加した。加重モデルの感度分析でも傾きの方向は維持された。この式を測定範囲外へ外挿しなかった。
この単元の要点
- 傾きはXの1単位変化に対する平均Y変化です。
- 最小二乗は垂直残差二乗和を最小化します。
- R²は説明割合であり、モデル適合の単独基準ではありません。
- 残差は曲率・不等分散・drift・外れ値を表します。
- 多項式項は事後p値競争でなく、機序と検証で選びます。
- 予測の根拠は観測・設計範囲内にあります。
次の単元からは観測されたX–Y関係を超え、複数入力を意図的に配置する実験計画法へ進みます。
公式補足資料
この記事のモデルとLabは教育用の合成資料です。