一覧へ

仮説検定が実際に問うこと: 差は偶然だけでも生じ得るか

観測差が標本抽出変動だけでも生じるかを、帰無仮説、対立仮説、p-value、有意水準、二種類の過誤の関係から説明します。

入門
|
48分
|
検証済み (2026-08-14)
帰無仮説対立仮説p-value有意水準第一種過誤第二種過誤検出力JMP
進捗0/28 (0%)

既存工程Aの平均収率は84.2、改善工程Bは85.5で、差は1.3でした。Bの数が大きいので直ちに改善成功と結論してよいでしょうか。

まだです。二工程の母平均が同じでも、異なる標本の標本平均は変わります。まず、効果がない基準世界でも1.3のような差がどれほど容易に現れるかを問います。

この単元の問いは一つです。
観測差は標本抽出変動だけでも十分に生じ得るか。

仮説検定はデータから原因の有無を自動判定する機械ではありません。基準統計モデルを置き、その下で現在結果の極端さを測り、証拠の一部を示します。

帰無仮説H0基準差や効果がないという検定の出発モデル
対立仮説H1研究質問が目指す違いの方向と形態
p-valueH0以下の観測値以上で極端な結果の確率
有意水準αH0が真のときに監修する第1種エラーの事前基準

観測差の背後には少なくとも二つの説明があります

標本に1.3の差が見えたとき、母平均は等しいが標本抽出変動で1.3が出た可能性と、母平均に差があり1.3が出た可能性があります。

第一の説明を基準世界の帰無仮説H0として形式化します。H0: μB−μA=0は母平均差0です。

研究質問の別説明が対立仮説H1です。方向を問わないならH1: μB−μA≠0、増加方向だけを事前に問うならH1: μB−μA>0です。

Figure 01 · 両方の説明の競争
観測差はH0世界でも起こり、H1世界でも起こりうる
H0・基準差0H1・実際の差の存在観察された検定統計量
仮説検定は、ある世界が真の確率を直接計算しません。まず、H0が作成した表集分布で現在の結果がどれほど異例であるかを評価します。

H0とH1はデータを見て有利に付ける説明ではありません。効果の定義、重要な方向、設計、分析モデルを研究質問と事前につなぎます。

H0は信じたい真実ではなく計算基準です

H0が現実で完全に真だと信じて始めるのではありません。効果なしの基準モデルを置き、現在データがどれほどそのモデルと両立するか調べる出発点です。

検定統計量は差を共通尺度に変えます

差1.3だけでは大きさを判断できません。値がほぼ揺れない実験の1.3と散らばりが大きい実験の1.3では証拠の強さが違います。

一般的な直観は次です。

検定統計量 = 観測効果とH0期待値の差 / 効果の標準誤差

効果が標本抽出変動に比べH0基準からどれほど遠いかを表します。具体的には問いとデータ構造によりt、F、χ²、順位統計量などを使います。後の単元で群数、結果型、独立・対応構造に沿って選びます。

p-valueはH0下の裾確率です

出発条件を省くと多くの誤解が生まれます。

H0と検定モデルの仮定が正しいとしたとき、観測検定統計量と同等以上にH1方向へ極端な結果が出る確率。

Figure 02 · p-valueの桁
p値はH0分布における観測値以上の極端な尾面積
H0下の黒統計量分布p/2p/2
両側検定では、両方向の極端性を合わせます。 p値は、H0が真である確率、結果が偶然である確率または効果の大きさではない。

両側p=.03なら、H0とモデル下で現在以上に両方向へ極端な統計量が出る長期比率が約3%という意味です。

p=.03は次を意味しません。

  • H0が真である確率が3%
  • 偶然が結果を生んだ確率が3%
  • H1が真である確率が97%
  • 反復の97%で再現される
  • 効果が大きい、または生物学的に重要
p-valueはデータだけの性質ではありません

同じ数値表でも検定方向、独立・対応構造、分布モデル、欠測処理、検定統計量が変わればp-valueも変わります。何を検定したかを伴わないp値は意味を失います。

有意水準αはデータを見る前に決めます

有意水準αはH0が真なのに棄却する第一種過誤を長期にどれほど許容するかの基準です。α=.05なら、H0と全手続仮定が正しい反復状況で約5%の偽陽性を許す規則です。

p < αH0棄却

H0基準世界で珍しい結果という証拠

p ≥ αH0 却下できない

効果なしの証明ではなく、証拠不足

効果サイズ違いはどれくらい大きいですか?

統計的有意性とは別の実質的な質問

信頼区間どの効果がデータと互換性があるか。

推定の範囲と方向を一緒に表現

p<αならH0下で十分極端なのでH0を棄却します。p≥αならH0を棄却する根拠が不足します。H0を採択・証明したのではありません。

小標本で散らばりが大きいと、重要な効果でもp≥αになり得ます。「非有意 = 差なし = 同等」は成立しません。同等性には事前同等性限界と目的に合う分析が必要です。

0.049と0.051は別の宇宙ではありません

閾値は意思決定規則を作りますが、証拠強度は境界で突然反転しません。正確なp値を効果量、信頼区間、設計品質、実質的重要性と共に報告します。

片側と両側は問いの方向です

両側H1は大きい・小さい両方向を差とみなします。右片側は大きい方向、左片側は小さい方向だけを研究質問にします。

Figure 04 · 方向は事前に
両側は2つの方向を、片側は研究によって定められた1つの方向を検定します
両側H1:違いがあるα/2α/2片側H1:より大きいα
データを見て有利な方向の単側検定に変えると、第1種エラー基準が崩れます。反対方向の重要な変化も見逃してはならない質問なら、両側が自然です。

片側検定はαを一方の裾に置くため事前方向の効果を検出しやすい一方、反対方向の大変化はそのH1の証拠に数えません。そのため、(1) データ前に方向を決める、(2) 反対方向が科学的に重要でないか別安全判断で扱う根拠を持つ、(3) 予想と反対の結果も報告する、ことが必要です。

データを見て平均が増えたから両側を右片側に変えると、実際の第一種過誤率が約束したαを超え得ます。

二種類の過誤は異なる失敗です

Figure 03 · 判断の四つ
テスト結果には常に2種類のエラーの可能性があります
判断H0 却下しないH0棄却実世界H0 真正しい決定H0 真第1種エラーαH1 真第2種エラーβH1 真検定力1−β
αは、H0が真であるのに棄却する長期比率である。 βと検定力は、特定の実際の効果を決定することによって計算することができ、U13で詳しく説明されています。
  • 第一種過誤: 真のH0を棄却する。効果がないのにあると判断する偽陽性
  • 第二種過誤: 指定H1が真なのにH0を棄却できない。実効果を見逃す偽陰性
  • 検出力1−β: 指定H1が真のとき正しくH0を棄却する確率

αは事前設定しますがβは普遍的な一数ではありません。真の効果量、散らばり、n、方向、方法で変わります。一般に大効果、小散らばり、大きい独立nは検出しやすく、標本サイズと検出力はU13で扱います。

反復するとp-valueも変わります

Labは基準平均μ0=10、既知σ=3の単純正規モデルでone-sample z検定を反復します。実分析を置き換えず、標本抽出変動、p-value、過誤を見る教育モデルです。

  1. δ=0、両側で80個のp-valueを見ます。H0が真でも稀にp<.05が出ます。
  2. New batch of 80で偽陽性数が変わるか見ます。
  3. δを0.5、1.0、1.5へ上げ、n=8と32を比べます。
  4. δが正なのに「小さい」片側H1を選び、データ方向と質問方向の衝突を見ます。
初めての場合:何を押すべきですか?
  1. 1.質問を最初に読むLabタイトルで今回比較する1つを確認してください。
  2. 2.条件を1つだけ変更する最初は、n、効果、散布などの入力の1つだけを変更します。
  3. 3. New batch of 80 押す新しい合成データが作成されます。同じ条件も標本によって変わり得る。
  4. 4. p-value分布と棄却回数 比較する変更の前後に何が動いて、何がそのままであるかを一文で書き留めてください。

詰まったら初期化に戻り、デフォルトの結果を見た後、条件を1つだけ置き換えます。このLabは正解判定器ではなく、パターン観察ツールです。

In-Silico Lab · Hypothesis Testing

同じ世界でもp値が変わるのを見てください

基準平均μ0=10、既知σ=3の教育用正規モデルです。実際の平均差、独立nと黒の方向を変え、80個の反復p値を観察します。

同じ設定で繰り返した80個のp値

α=.05
p<.05 p≥.05

最初のサンプルと反復結果

最初のx̄9.857
最初のz-0.213
最初のp0.8312
最初の判断H0 却下できない
80回p <.055/80

H0が真であっても、一部のサンプルはα= .05で偽陽性を生成します。

教育用 one-sample z test: μ0=10 · known σ=3 · α=.05 · 正規独立標識 · simulator_version:u07-ztest-guided-v1。実際の研究では、未知のσ、設計構造、検定仮定、多重性などを反映した方法を選択する必要があります。

80回中正確に4回がp<.05になる必要はありません。α=.05は各batchへの5%割当ではなく、同手順を長期反復した誤り率です。

p-valueが小さくなる三経路を分けます

  • 観測効果が大きいと検定統計量が増え得ます。
  • 散らばりが小さいと同じ効果が明瞭になります。
  • 独立nが大きいと標準誤差が減り、非常に小さい効果も低いp-valueを作れます。

したがって大標本のp<.001でも実験上些細な効果かもしれず、小さな探索研究のp=.08でも重要効果を排除したとは言えません。どちらも効果量とCIを読みます。

JMP出力は証拠の要素を分けて示します

JMP報告名は分析構造で違いますが、核心は検定統計量、p-value、H1、効果、信頼区間の関係です。

Test Statistic

効果を標準誤差と比較してH0基準尺度に移した値です。

Prob > |t|またはp値

選択した両側・片側H1に合う尾確率を読み込みます。

Difference + Confidence Interval

差の方向・大きさと両立可能な範囲をp-valueと一緒にみます。

両側t検定のProb > |t|のように出力名が裾を示すことがあります。片側p-valueでは符号と事前H1方向の一致を確認し、最小に見えるp-valueを事後選択しません。

Figure 05 · 黒の流れ
αと仮説はデータを見る前に、解釈は効果の大きさで決まります
質問効果・方向仮説H0 · H1基準α・モデル素材統計量・p結論効果・CIとともにp<αだけ残さず、質問・家庭・効果の大きさまで再接続する
p-value は、全体的な判断フローの要素です。検定の選択、仮定、欠落、多重性、サンプル構造も結論に影響します。

統計ソフトは、各行が正しい独立実験単位か、仮定と標本選択が妥当か、多数の結果から有利な分析だけを選んでいないか、効果が生物学的・臨床的・品質的に重要か、新実験で再現するかを保証しません。

棄却か否かより豊かに報告します

悪い文:

p<.05なので改善工程には効果がある。

より良い文:

独立batchの事前指定両側分析で平均収率差B−Aは1.3 percentage points、95% CIは−1.8–4.4、p=.39だった。この標本ではH0を棄却できず、改善効果なしや工程同等性を示す根拠ではない。

分析法、独立n、効果単位、CI、正確なp-value、方向、事前指定の有無を残します。p-valueは一文字の結論ではなく証拠文の一部です。

終了前に確認する七文

  • H0は効果なしの基準モデル、H1は研究方向を含みます。
  • 検定統計量は観測効果を標準誤差に照らしH0尺度へ変えます。
  • p-valueはH0とモデル下で観測以上に極端な結果の確率です。
  • p-valueはH0が真の確率でも効果量でもありません。
  • p≥αではH0を採択せず、棄却できません。
  • αは真のH0下の第一種過誤基準で、データ前に定めます。
  • 棄却判断は効果量、CI、設計、実質的意味を代行しません。
p値は効果が存在する確率ではありません。H0とモデルが作成した基準世界で現在の結果がどれほど極端なのかを示し、効果の大きさ・CI・設計・生物学的意味とともに読まなければなりません。

次単元では二群平均比較の前に散らばりは同じかを問います。等分散仮定と、分散検定一つで分析法を機械的に分けてはいけない理由を学びます。

公式補足資料

この記事の数値、図、In-Silico Labは統計概念を説明する合成資料です。実研究・臨床・品質・規制判断の根拠には使えません。

💬 質問・コメント

0件のコメント

ログインせずに投稿できます。ゲスト投稿は投稿者自身で編集・削除できません。

0/2000

読み込み中...