実験AとBの平均応答値がどちらも10だとします。報告書に平均しかなければ同じ結果に見えます。しかしAが10の周りに密集し、Bが2から18まで広がっていたら、本当に同じ結果でしょうか。
平均が同じなら、二つのデータも同じか。
答えはいいえです。平均は中心を有用に要約しますが、中心からの距離、長い裾、異なる群の混在までは示しません。平均が役に立たないのではなく、平均が語ることと語れないことを区別する必要があります。
最初から全用語を覚える必要はありません。下の五語を羅針盤にし、図で必要になった言葉を一つずつ加えましょう。
計算より先に確認すること: 一行は何を表すか
平均や標準偏差を計算する前に、表の一行が何を意味するか確認します。異なる三つの培養wellを一回ずつ測る場合も、一つのwellを同じ装置で三回読む場合も三行になりますが、同じ証拠ではありません。
実験単位は処置が独立に適用される最小単位です。異なる実験単位から得た反復が生物学的反復、同じ単位の反復測定が技術反復です。計算表では技術反復を明示した規則で整理し、独立実験単位一つを一行にします。
平均が完全に同じ二組
各値を一つの生物学的実験単位の相対応答とします。AとBは研究データではなく教育用の合成値です。
| 組 | 観測値 | 平均 | 中央値 | 標本分散 | 標本標準偏差 |
|---|---|---|---|---|---|
| A | 8, 9, 10, 11, 12 | 10 | 10 | 2.5 | 1.58 |
| B | 2, 6, 10, 14, 18 | 10 | 10 | 40 | 6.32 |
平均は合計を個数で割った値です。AもBも合計50、五個なので平均10です。この速い中心の要約は点間距離を一数に圧縮するため、中心の横に散らばりが必要です。
点と平均の距離を数に変える
各観測値から平均を引いた値が偏差です。Aは−2, −1, 0, 1, 2、Bは−8, −4, 0, 4, 8で、Bの方が明らかに広いです。偏差をそのまま足すと左右が相殺され、どちらも0になります。距離を残すため偏差を二乗し、遠い点ほど大きな重みを持たせます。
なぜnではなくn−1で割るのでしょうか
標本自身の平均を中心にすると、未知の母集団中心を基準にした場合より散らばりを小さく見積もる傾向があります。標本平均がその標本に最も近い中心として既に当てはめられているためです。標本分散でn−1を使うのは、この傾向を補正するためです。
n−1の証明は自由度と期待値を扱う後の段階に属します。今は、標本から中心を一つ推定したため独立な距離情報がn−1個残る、という直観で十分です。
Aの標本標準偏差は約1.58、Bは約6.32です。同じ平均でもBの典型的な広がりは大きいです。ただし小さい標準偏差が必ず良い実験を意味しません。検出限界、依存した技術反復、狭く選んだ試料範囲でも小さい散らばりは生じます。
平均と標準偏差だけでも形は全部見えません
中心と散らばりを一緒に見ても全体の形は残ります。値が中心の両側に釣り合う場合、右に長い裾を持つ場合、二群に見える場合があります。この形が分布です。
二つの山が見えても、二種類の細胞が混ざったとは証明できません。batch、処置時点、装置状態、隠れた下位群の可能性もありますが、小標本やbinの選び方が作った形かもしれません。グラフは原因への判決ではなく、次に確認する問いの地図です。
二群で同じx軸範囲とbin境界を使います。小標本ではbinの小さな変更で形が大きく変わるため、ヒストグラムと元データ点を一緒に確認します。
中央値と箱ひげ図は何を加えるでしょうか
中央値は値を並べた中央の値で、遠い極端値に平均ほど引かれません。Q1とQ3は25%と75%の位置、その差のIQRは中央50%が占める幅です。
箱ひげ図はこの順序情報を圧縮します。箱の両端がQ1とQ3、箱内の線が中央値です。ひげは通常範囲の端を示し、外側の点は外れ値候補として表示されることがあります。
まず試料ID、元記録、単位、装置ログ、時点、実験条件を確認します。誤りが確認されたら事前規則と根拠に従い、有効な観測なら安易に除きません。除外前後で結論がどう変わるかも記録します。
同じ平均を自分で作ってみましょう
ここまでは著者が選んだ値でした。実際の標本は毎回同じになりません。下のmini LabでBの散らばりと形を変えてください。教育のため両群の平均を正確に10に固定しているので、これは無作為標本ではなく構成された比較データです。
平均10を固定し、Bの形を変えてみてください
基準比較では平均を固定し、散布と形状の違いに集中します。以下のデータは研究結果ではなく、統計概念を観察するように構成された教育用合成データです。
初めての場合:何を押すべきですか?
- 1.質問を最初に読むLabタイトルで今回比較する1つを確認してください。
- 2.条件を1つだけ変更する最初は、n、効果、散布などの入力の1つだけを変更します。
- 3. 分布形状または散布条件の変更 押す新しい合成データが作成されます。同じ条件も標本によって変わり得る。
- 4. 2つの集団の点図と要約値 比較する変更の前後に何が動いて、何がそのままであるかを一文で書き留めてください。
詰まったら初期化に戻り、デフォルトの結果を見た後、条件を1つだけ置き換えます。このLabは正解判定器ではなく、パターン観察ツールです。
原料店と平均線
今回の比較のまとめ
研究・臨床・品質判断には使用しないでください。正式なLabでは、生成モード、シード、シミュレータバージョン、単位、1行の意味、raw/analysis-readyテーブルとデータ辞書を一緒に提供します。
形を変えてもBの平均は10のままですが、点の幅、裾、集まり方が変わります。正式Labの自由探索では目標中心を10にしても、実標本平均は毎回正確に10にはなりません。生成目標と偶然得た一標本の要約は異なるため正常です。
JMPはこの理論をどう表すでしょうか
ここでのJMPはボタン順を学ぶためではなく、これまでの関係を出力につなぐために使います。連続データのJMP Distributionは三つの結果群を一緒に示します。
値が置かれた全体形状と中心・中央幅・異常値候補を一緒にみます。
最小値、Q1、中央値、Q3、最小値など、順序に基づいた位置を確認します。
平均、標準偏差、Nのように中心と散布を数値で確認します。
AとBでは、まずNが独立実験単位数と一致するか確認します。Summary Statisticsで平均と標準偏差を一緒に読み、histogramと元データ点で幅・裾・群を調べ、QuantilesとOutlier Box Plotで中央値、IQR、外れ値候補を確認します。
両平均が10でも止まりません。Bの標準偏差が大きくヒストグラムが広ければ「同じ中心、異なる距離」です。ひげ外の点は削除せず履歴を調べます。二峰性ならbatchや隠れた条件を調べる仮説にはなりますが、原因の確定ではありません。
理論と本文の代表結果だけでも学べます。JMPやMinitabがあればLabからコピーした表で中心・散らばり・分布を確認してください。画面配置が違っても読む統計関係は同じです。
今日から平均の横に置く四つの問い
- この平均に入った独立nはいくつか。 技術反復行を独立標本として数えていないか確認します。
- 値は中心からどれほど広がるか。 標準偏差と元データ点の幅を一緒に見ます。
- 分布の形はどうか。 同じ軸・同じbinのヒストグラムで裾と群を調べます。
- 変わった点は何を要求するか。 自動削除ではなく試料と測定過程の再確認です。
平均は誤った数ではありません。ただし多くの情報を一数に圧縮します。良い分析は平均を捨てず、その横に散らばり、分布、元データ、反復構造を戻します。
次の単元では問いを広げます。手元の標本平均と標準偏差は母集団全体をどれほど表すでしょうか。同じ実験を繰り返すと値が変わる理由と、その揺れの表し方を学びます。
公式補足資料
- JMP Help · Distributions of Continuous Variables
- JMP Statistics Knowledge Portal · Box Plot
- NIST/SEMATECH e-Handbook · Measures of Scale
この記事の例とmini Labは統計概念を説明するための合成データです。実研究・臨床・品質・規制判断の根拠には使えません。