培養液中の代謝物濃度が高いほど、細胞生存率も高くなりました。二つの変数の相関係数がr=.78なら、代謝物を増やせば生存率が上がると結論づけられるでしょうか。相関は出発点ですが、原因についての結論ではありません。
この単元の問いは一つです。
二つの変数が共に動くという事実から、どこまで言えるでしょうか。
相関係数は線形な連動を−1から+1に圧縮します
Pearsonの相関係数rは、二つの変数がそれぞれの平均から外れる方向を共にするかを標準化して要約します。
- r>0:Xが大きい観測でYも大きくなる線形の傾向
r < 0:Xが大きい観測でYは小さくなる線形の傾向- |r|が1に近い:点が一本の直線の近くにある
- r≈0:線形な連動が弱い
r=0は関係がないことを意味しません。完全なU字型の関係では、両側の傾きが相殺されてrが0付近になることがあります。一つの数値を計算する前に散布図を描くべきです。
相関係数はXとYの単位を消すため比較しやすくなりますが、実際の変化量は示しません。「Xが1増えるとYがどれだけ変わるか」は回帰係数の問いであり、次の単元で扱います。
同じrでも全く異なるデータを隠すことがあります
散布図で次の要素を確認してください。
- 線形性:直線の周辺にあるか、曲線・閾値・飽和があるか。
- 外れ値:一、二点が方向と大きさを支配していないか。
- 範囲制限:Xの狭い一部だけを観測していないか。
- 群集:plate、donor、日付ごとのまとまりがあるか。
- 不均一分散:Xが大きくなるほどYの広がりも大きくなるか。
- 測定誤差:XとYの反復精度が関係を弱めていないか。
対象を健康な成人に限定すると、全人口では強い年齢と指標の関係が弱く見えることがあります。逆に二つのbatch群集をまとめると、各群集内に関係がなくても全体のrが大きくなることがあります。
一人のdonor由来の20個の細胞を20個の独立点として描くと、群集構造のためp値が過度に小さくなることがあります。donorごとの要約、反復測定相関、または階層モデルが必要です。点の数と独立情報量は同じではありません。
相関は方向を入れ替えても同じ値であり、原因を指定しません
cor(X,Y)=cor(Y,X)です。相関は、どちらが説明変数でどちらが反応なのかを決めません。高いrには複数の説明があります。
- XがYに影響する。
- YがXに影響する。
- 第三の変数Zが両方に影響する。
- 選択、測定、時間的傾向が人工的な関係を作った。
- 偶然と多重探索により大きなrが選ばれた。
因果を判断するには、時間順序、操作可能な設計、無作為化、交絡の制御、機序、再現が必要です。相関のp値が小さくても、これらの条件が自動的に満たされるわけではありません。
p値とCIはnに依存します
H0:母集団の線形相関ρ=0の検定にはrとnを使います。nが大きければ小さなrでも有意になり得ます。nが小さければ大きなrのCIも広くなります。r、CI、独立n、散布図を一緒に報告してください。
多くの遺伝子とendpointの相関行列で数千件を検定すると、偶然に小さなp値が多数生じます。解析前に候補を絞るか、FDRなどの多重性制御と独立した検証を計画する必要があります。
In-Silico Lab:rの脆さを自分で作ります
- 傾きを−2、0、+2に変えてrの方向を見ます。
- 曲率を上げ、関係は強いのにrが弱い状況を作ります。
- 一つの外れ値を加え、rがどれほど動くかを見ます。
- 新しいseedで、同じ生成条件の標本rが変わるかを確認します。
散布図を変えてrの脆弱性を見てください
傾き・noise・曲率・異常値を変えて、同じ係数の後に他の形状が隠れるか確認します。
初めての場合:何を押すべきですか?
- 1.質問を最初に読むLabタイトルで今回比較する1つを確認してください。
- 2.条件を1つだけ変更する最初は、n、効果、散布などの入力の1つだけを変更します。
- 3. 新しい合成サンプル 押す新しい合成データが作成されます。同じ条件も標本によって変わり得る。
- 4. 図と計算結果 比較する変更の前後に何が動いて、何がそのままであるかを一文で書き留めてください。
詰まったら初期化に戻り、デフォルトの結果を見た後、条件を1つだけ置き換えます。このLabは正解判定器ではなく、パターン観察ツールです。
同じ設定の合成観測
計算結果
r は線形形状の要約です。因果・再現性・群集独立性は別途質問です。
教育用 synthetic model ·bjs-relationship-sequence-v1。実際の研究判断には、実験単位、欠測、分布、多重性、事前計画とドメイン基準を別々に反映しなければなりません。
Labの線は説明を助ける単純回帰線です。線が見えても、因果や外挿可能性が生まれるわけではありません。
JMPでは行列より先に各散布図を見ます
相関係数より先に形状・範囲・群集・異常値を表示します。
rの符号と大きさ、nとp値を一緒に読み込みます。
楕円は線形関係表現であり、因果構造を保証しません。
Correlation Matrixは多くの組を圧縮しますが、非線形や外れ値を隠します。Scatterplot Matrixで各組の形を確認し、density ellipseは線形正規構造を要約する補助表現として読みます。楕円の傾きは因果の方向を示しません。
結果文の例
独立した42 batchにおいて、代謝物XとviabilityのPearson相関は.61(95% CI .38–.77)でした。散布図には正の線形傾向が見られましたが、二つの高濃度点の影響があり、batch日付で色分けすると群集が一部を説明しました。この観察研究の相関を、Xを増やす因果効果とは解釈しませんでした。
この単元のまとめ
- rは線形な連動の方向と標準化された大きさです。
- r≈0でも非線形の関係があることがあります。
- 外れ値、範囲制限、群集、交絡はrを大きく変えます。
- 相関はXとYの因果方向を決めません。
- p値だけでなく、r・CI・独立n・散布図を一緒に見ます。
- 大規模な相関探索には多重性の制御と検証が必要です。
次の単元では、関係をY=β₀+β₁X+εで表し、直線が見落としたものを残差から探します。
公式補足資料
この記事の例とLabは教育用合成データです。