一覧へ

関係を式で表し診断する: 回帰と残差

回帰の傾き、切片、予測値、最小二乗、R²を説明し、残差図で曲率・不等分散・drift・外れ値を診断します。

中級
|
30分
|
検証済み (2026-08-14)
回帰傾き切片最小二乗残差R-squaredlack of fitJMP
進捗0/28 (0%)

相関係数は二変数が一緒に動く程度を要約しますが、「Xが1単位変わると平均Yがどれだけ変わるか」は直接言いません。回帰はこの問いを式で表します。

この単元の問いは一つです。


一本の直線は関係をどこまで説明でき、どこで失敗するか。
傾斜X 1単位変化による平均Y変化
予測値 ŷ適合式が各Xで示した値
残差 e観測値yから予測値ŷを引いた差
R²観測Y変動中のモデルが説明した比率

単純線形回帰は平均関係を二つの係数へ圧縮します

Yᵢ=β₀+β₁Xᵢ+εᵢ

  • β₀ 切片: X=0のときの平均Y
  • β₁ 傾き: Xが1単位増えるときの平均Yの変化
  • εᵢ 誤差: 式が説明しない個別変動

標本では ŷᵢ=b₀+b₁xᵢ を適合します。傾きの単位はY単位/X単位です。Xが濃度mg/mL、Yがviability percentage pointなら、その単位を保って初めて科学的意味を持ちます。

X=0が観測範囲外なら、切片は計算上必要でも実質的解釈を持たないことがあります。研究上意味のある中心値でXを中心化すれば、切片をその基準での平均応答にできます。

最小二乗は垂直残差の二乗和を最小化します

残差は eᵢ=yᵢ−ŷᵢ です。最小二乗は Σeᵢ² が最小の直線を選びます。二乗により大きい残差は大きな影響を持つため、外れ値の測定原因と影響力を必ず確認します。

U15 · Figure 01
直線が逃した構造は残差図に再び現れる
観測値と適合直線残差 = y − ŷ
左の直線は平均傾向を要約しますが、右の残差のU字パターンは線形式に曲率項がなくなったことを示します。

残差が正なら観測値は予測より高く、負なら低いことを示します。適切な線形モデルの残差は、予測値とrun順に対して特別な構造なく0の周りに散るべきです。

R²は説明割合であって品質保証書ではありません

R²=1−SSE/SST

R²は観測Yの総変動のうち、標本内で適合式が説明した割合です。単純回帰ではr²と等しくなります。しかし高いR²も次を保証しません。

  • 直線の関数形が正しいこと
  • 残差分散が一定なこと
  • 誤差が独立なこと
  • 重要な変数が欠けていないこと
  • 関係が因果的なこと
  • 新しいデータへの予測が良いこと

X範囲を広げればR²は高くなり、狭めれば低くなり得ます。応答変動が本質的に小さい領域では、低いR²でも有用な平均効果を持ち得ます。

R²が高くても残差にU字があれば直線は誤りです

予測値対残差図の曲線、漏斗、時間傾向、クラスター、極端点を確認してください。一つの数値要約は構造的なモデル失敗を隠せます。

四つの残差パターンは異なる問題を示します

  1. U字・S字: 線形式に曲率や変換が必要かもしれません。
  2. 漏斗: 平均水準により分散が変わります。
  3. run順の傾向: drift、自己相関、batch変化です。
  4. 孤立した大残差: 測定誤差、別母集団、影響点です。

残差形だけを見て都合のよい多項式次数を追加し続けるのは修正ではありません。機序、設計範囲、事前の候補モデルに基づいて項を選び、新しいデータまたは交差検証で確かめます。

反復X水準があればpure errorとlack of fitを分けられます。lack-of-fit検定は候補関数が反復誤差より大きい系統的失敗を示すかを助けますが、非有意でもモデルが真という意味ではありません。

外挿は直線をさらに遠くへ引く行為ではありません

観測Xが1–5なのにX=20を予測すれば、応答機序、飽和、毒性、物理的境界が異なるかもしれません。回帰式の代数値は計算できますが、根拠は設計範囲内にあります。予測区間はモデルが正しい条件下の不確実性であり、外挿を正当化しません。

In-Silico Lab: モデルを意図的に失敗させます

  1. 曲率0で適合直線とR²を見ます。
  2. 曲率を1.2、2へ上げ、R²と残差構造を比べます。
  3. 外れ値一つを加え、傾きとSSEの変化を見ます。
  4. seedを変え、標本適合が生成モデルをどの程度揺れて推定するか確認します。
In-Silico Lab · U15

直線と残差を同時に診断する

直線適合後、R²と残差が曲率・異常値を互いに異なって表わすかどうかを確認します。

初めての場合:何を押すべきですか?
  1. 1.質問を最初に読むLabタイトルで今回比較する1つを確認してください。
  2. 2.条件を1つだけ変更する最初は、n、効果、散布などの入力の1つだけを変更します。
  3. 3. 新しい合成サンプル 押す新しい合成データが作成されます。同じ条件も標本によって変わり得る。
  4. 4. 図と計算結果 比較する変更の前後に何が動いて、何がそのままであるかを一文で書き留めてください。

詰まったら初期化に戻り、デフォルトの結果を見た後、条件を1つだけ置き換えます。このLabは正解判定器ではなく、パターン観察ツールです。

同じ設定の合成観測

計算結果

相関r0.679
傾斜1.726
R²0.461
SSE276.26

高いR²も残差の曲線パターンを消去しません。測定範囲外外挿は特に禁止します。

教育用 synthetic model ·bjs-relationship-sequence-v1。実際の研究判断には、実験単位、欠測、分布、多重性、事前計画とドメイン基準を別々に反映しなければなりません。

JMP結果は係数表から残差へ移ります

Parameter Estimates

切片・傾き推定とSE・CIを実際の単位で読み出します。

Summary of Fit

R²は説明の比率であり、モデル適合性の単独の証明ではありません。

Residual Plot / Lack of Fit

曲率・二分散・時間ドリフト・異常値構造を探します。

Parameter Estimatesの係数・SE・CI、Summary of FitのR²・RMSE、Analysis of Varianceのモデル検定を読んだ後、必ずresidual plotとactual by predictedを見ます。Polynomial項はメニューで簡単に追加できるからではなく、科学的候補と診断に従って使います。

結果文の例

独立batch 38件で濃度1–5 mg/mL範囲の線形モデルを適合した。傾きは2.4 percentage points/(mg/mL)、95% CI 1.6–3.2、R²=.48だった。残差対予測図に明瞭な曲率はなかったが、高濃度で分散が増加した。加重モデルの感度分析でも傾きの方向は維持された。この式を測定範囲外へ外挿しなかった。

この単元の要点

  • 傾きはXの1単位変化に対する平均Y変化です。
  • 最小二乗は垂直残差二乗和を最小化します。
  • R²は説明割合であり、モデル適合の単独基準ではありません。
  • 残差は曲率・不等分散・drift・外れ値を表します。
  • 多項式項は事後p値競争でなく、機序と検証で選びます。
  • 予測の根拠は観測・設計範囲内にあります。
回帰式は関係を圧縮した候補モデルです。 R²よりも残差構造と外挿範囲を最初に確認する必要があり、予測は科学的な質問に耐えます。

次の単元からは観測されたX–Y関係を超え、複数入力を意図的に配置する実験計画法へ進みます。

公式補足資料

この記事のモデルとLabは教育用の合成資料です。

💬 質問・コメント

0件のコメント

ログインせずに投稿できます。ゲスト投稿は投稿者自身で編集・削除できません。

0/2000

読み込み中...