工程AとBの平均収量がともに82だとします。Aは大半が80–84に集まり、Bは70–94まで広く揺れます。平均だけなら同じに見えても、次のbatchの予測可能性と平均差の標準誤差はまったく同じではありません。
この単元の問いは一つです。
二群の広がりが異なると、平均比較の不確実性はどう変わるか。
ばらつきは平均比較の背景ノイズです
二平均の観測差は、各群内の自然変動と比べなければなりません。値が密集していれば小さな平均差も明瞭ですが、広く散れば同じ差も標本抽出変動に埋もれます。二群の母分散が同じと置く条件を等分散、異なると置く条件を不等分散と呼びます。
等分散は二つの標本SDが同じでなければならないという意味ではありません。同じ母分散から採っても標本SDは毎回異なります。逆に二SDが偶然似ていても、分布形や標本サイズが違えば平均比較の不確実性が同じとは限りません。
まず各群のdot plot、box plot、SDを並べて見ましょう。広がった理由が全体的なscale変化、一二個の外れ値、右裾、異なる下位集団の混合のどれかを区別します。分散検定はこの図の代わりになりません。
ばらつきの検定は同じ問いを同じ方法で尋ねません
共通の帰無仮説は概ね H0: σ₁²=σ₂²=…=σk² ですが、検定統計量がばらつきを測る方法と分布仮定は異なります。
- 二群の F test は標本分散の比をF分布と比べ、正規モデルに敏感です。
- Bartlett test は複数群で効率的なことがありますが、非正規性と外れ値に敏感です。
- Levene test は各観測値の群中心からの絶対距離を新しい応答のように比較します。
- 平均でなくmedianを中心にするLevene変形はしばしば Brown–Forsythe と呼ばれ、裾や外れ値により頑健な選択になり得ます。
検定名を暗記するより、どの中心と距離を使うか、正規性逸脱にどれほど敏感かを問いましょう。
ばらつき検定が非有意とは、現在の標本で分散差を検出する証拠が足りないという意味です。小さいnでは大きな分散比も見逃します。「同じ」の証明やpooled t-testの自動許可に使わないでください。
一つの事前検定で平均検定を分けないでください
昔のよくある手順は、まず等分散を検定し、有意ならWelch t-test、非有意ならpooled t-testを選ぶものでした。この二段階の自動分岐は最終的なエラー率と不確実性を複雑にし、小標本では不安定です。
解析選択はデータを見る前に、設計と科学的仮定で決める方がよいでしょう。二独立群の平均比較では、Welch法は群別の分散とnを別に反映するため、等分散が確かでない場面で有用な頑健な代案です。ただしすべての設計の唯一の答えではなく、対応・クラスター・反復測定・打ち切り資料には構造に合うモデルが必要です。
In-Silico Lab: 平均を固定し、幅だけを変えます
Labでは二群の真平均は同じです。BのSD比、n、seedだけを変えます。
- SD比を1から3へ上げ、標本SD比が毎回設定値と正確に一致しないことを見ます。
- n=8とn=40で新しい標本を反復し、ばらつき推定の揺れを比べます。
- SDとmedian absolute deviationが同じ方向に動かない標本を探します。
- 平均が同じことが安定性も同じことを意味するか、再び答えます。
平均を固定して散布だけを変えてみてください
同じ平均を持つ2つの集団でBのSD比を変え、サンプルSDと robust distanceがどのように動くかを見てください。
初めての場合:何を押すべきですか?
- 1.質問を最初に読むLabタイトルで今回比較する1つを確認してください。
- 2.条件を1つだけ変更する最初は、n、効果、散布などの入力の1つだけを変更します。
- 3. 新しい合成サンプル 押す新しい合成データが作成されます。同じ条件も標本によって変わり得る。
- 4. 図と計算結果 比較する変更の前後に何が動いて、何がそのままであるかを一文で書き留めてください。
詰まったら初期化に戻り、デフォルトの結果を見た後、条件を1つだけ置き換えます。このLabは正解判定器ではなく、パターン観察ツールです。
同じ設定の合成観測
計算結果
サンプル散布の違いは、データが作成する証拠です。 1つのp値で、2つの母集団の分散が同じであることを証明することはできません。
教育用 synthetic model ·bjs-comparison-sequence-v1。実際の研究判断には、実験単位、欠測、分布、多重性、事前計画とドメイン基準を別々に反映しなければなりません。
Labはばらつき検定のp-valueを競わせません。まず どのデータ生成条件がどのばらつき要約を変えるか を見せます。実資料では、元データ図、標本サイズ、外れ値の原因、測定上限・下限、独立性も一緒に検討します。
JMP出力は複数の感度を並べて見るためのものです
F・Levene・Brown-Forsythe類の結果は、同じ散布質問を異なる感度で見ています。
サンプルSDのサイズと不確実性を最初に画像として確認します。
p値一つではなく分布形状・n・異常値とともに判断します。
目的はJMPの過去のメニュー経路をなぞることではありません。各検定が同じH0をどの方法で調べるか、Std DevとCIが実際の規模をどれだけ示すかを読みます。複数p-valueのうち最も都合のよい一つを選んで結論しません。
報告文ではばらつきと平均の問いを分けます
悪い文:
Levene p=.31なので二分散は同じであり、pooled t-testを用いた。
より良い文:
独立batchの標本SDはAで1.8、Bで3.1だった。Bにより広いばらつきと右裾が観察された。平均差は事前指定のWelch法で推定し、ばらつき比較は元データ図とmedianベースLevene結果とともに感度情報として示した。
分散差自体が研究の問いなら、分散比またはscale差のCIを報告します。平均比較の仮定確認なら、平均効果とCIが中心で、ばらつき検定は補助診断です。
この単元の要点
- 等分散は母集団モデルの仮定であり、二標本SDの一致ではありません。
- ばらつき差は平均差の標準誤差と予測可能性を変えます。
- F・Bartlettは正規性逸脱に敏感で、Levene類は中心距離で頑健性を高めます。
- 非有意のばらつき検定は等分散の証明ではありません。
- ばらつき検定の後に解析法を機械的に変えません。
- 元データ図と実験単位はすべての検定に先立ちます。
次の単元では一群の平均を外部基準値と比べ、効果・標準誤差・CI・p-valueを一つの結果文にまとめます。
公式補足資料
この記事の数値・図・Labは教育用の合成資料です。実際の研究・臨床・品質・規制判断の単独根拠にはできません。