既存工程Aの平均収率は84.2、改善工程Bは85.5で、差は1.3でした。Bの数が大きいので直ちに改善成功と結論してよいでしょうか。
まだです。二工程の母平均が同じでも、異なる標本の標本平均は変わります。まず、効果がない基準世界でも1.3のような差がどれほど容易に現れるかを問います。
観測差は標本抽出変動だけでも十分に生じ得るか。
仮説検定はデータから原因の有無を自動判定する機械ではありません。基準統計モデルを置き、その下で現在結果の極端さを測り、証拠の一部を示します。
観測差の背後には少なくとも二つの説明があります
標本に1.3の差が見えたとき、母平均は等しいが標本抽出変動で1.3が出た可能性と、母平均に差があり1.3が出た可能性があります。
第一の説明を基準世界の帰無仮説H0として形式化します。H0: μB−μA=0は母平均差0です。
研究質問の別説明が対立仮説H1です。方向を問わないならH1: μB−μA≠0、増加方向だけを事前に問うならH1: μB−μA>0です。
H0とH1はデータを見て有利に付ける説明ではありません。効果の定義、重要な方向、設計、分析モデルを研究質問と事前につなぎます。
H0が現実で完全に真だと信じて始めるのではありません。効果なしの基準モデルを置き、現在データがどれほどそのモデルと両立するか調べる出発点です。
検定統計量は差を共通尺度に変えます
差1.3だけでは大きさを判断できません。値がほぼ揺れない実験の1.3と散らばりが大きい実験の1.3では証拠の強さが違います。
一般的な直観は次です。
検定統計量 = 観測効果とH0期待値の差 / 効果の標準誤差
効果が標本抽出変動に比べH0基準からどれほど遠いかを表します。具体的には問いとデータ構造によりt、F、χ²、順位統計量などを使います。後の単元で群数、結果型、独立・対応構造に沿って選びます。
p-valueはH0下の裾確率です
出発条件を省くと多くの誤解が生まれます。
H0と検定モデルの仮定が正しいとしたとき、観測検定統計量と同等以上にH1方向へ極端な結果が出る確率。
両側p=.03なら、H0とモデル下で現在以上に両方向へ極端な統計量が出る長期比率が約3%という意味です。
p=.03は次を意味しません。
- H0が真である確率が3%
- 偶然が結果を生んだ確率が3%
- H1が真である確率が97%
- 反復の97%で再現される
- 効果が大きい、または生物学的に重要
同じ数値表でも検定方向、独立・対応構造、分布モデル、欠測処理、検定統計量が変わればp-valueも変わります。何を検定したかを伴わないp値は意味を失います。
有意水準αはデータを見る前に決めます
有意水準αはH0が真なのに棄却する第一種過誤を長期にどれほど許容するかの基準です。α=.05なら、H0と全手続仮定が正しい反復状況で約5%の偽陽性を許す規則です。
H0 기준 세계에서 보기 드문 결과라는 증거
효과 없음의 증명이 아니라 증거 부족
통계적 유의성과 별개의 실질적 질문
추정의 범위와 방향을 함께 표현
p<αならH0下で十分極端なのでH0を棄却します。p≥αならH0を棄却する根拠が不足します。H0を採択・証明したのではありません。
小標本で散らばりが大きいと、重要な効果でもp≥αになり得ます。「非有意 = 差なし = 同等」は成立しません。同等性には事前同等性限界と目的に合う分析が必要です。
閾値は意思決定規則を作りますが、証拠強度は境界で突然反転しません。正確なp値を効果量、信頼区間、設計品質、実質的重要性と共に報告します。
片側と両側は問いの方向です
両側H1は大きい・小さい両方向を差とみなします。右片側は大きい方向、左片側は小さい方向だけを研究質問にします。
片側検定はαを一方の裾に置くため事前方向の効果を検出しやすい一方、反対方向の大変化はそのH1の証拠に数えません。そのため、(1) データ前に方向を決める、(2) 反対方向が科学的に重要でないか別安全判断で扱う根拠を持つ、(3) 予想と反対の結果も報告する、ことが必要です。
データを見て平均が増えたから両側を右片側に変えると、実際の第一種過誤率が約束したαを超え得ます。
二種類の過誤は異なる失敗です
- 第一種過誤: 真のH0を棄却する。効果がないのにあると判断する偽陽性
- 第二種過誤: 指定H1が真なのにH0を棄却できない。実効果を見逃す偽陰性
- 検出力
1−β: 指定H1が真のとき正しくH0を棄却する確率
αは事前設定しますがβは普遍的な一数ではありません。真の効果量、散らばり、n、方向、方法で変わります。一般に大効果、小散らばり、大きい独立nは検出しやすく、標本サイズと検出力はU13で扱います。
反復するとp-valueも変わります
Labは基準平均μ0=10、既知σ=3の単純正規モデルでone-sample z検定を反復します。実分析を置き換えず、標本抽出変動、p-value、過誤を見る教育モデルです。
- δ=0、両側で80個のp-valueを見ます。H0が真でも稀に
p<.05が出ます。 New batch of 80で偽陽性数が変わるか見ます。- δを0.5、1.0、1.5へ上げ、n=8と32を比べます。
- δが正なのに「小さい」片側H1を選び、データ方向と質問方向の衝突を見ます。
처음이라면: 무엇을 눌러야 하나요?
- 1. 질문을 먼저 읽기Lab 제목에서 이번에 비교할 한 가지를 확인합니다.
- 2. 조건 하나만 바꾸기처음에는 n, 효과, 산포 같은 입력 중 하나만 바꾸십시오.
- 3. New batch of 80 누르기새 합성 데이터가 만들어집니다. 같은 조건도 표본에 따라 달라질 수 있습니다.
- 4. p-value分布と棄却回数 비교하기바꾸기 전후 무엇이 움직이고 무엇이 그대로인지 한 문장으로 적어보십시오.
막히면 초기화로 돌아가 기본 결과를 본 뒤 조건 하나만 바꾸십시오. 이 Lab은 정답 판정기가 아니라 패턴 관찰 도구입니다.
같은 세계에서도 p-value가 달라지는 것을 보세요
기준 평균 μ0=10, 알려진 σ=3인 교육용 정규모형입니다. 실제 평균 차이, 독립 n과 검정 방향을 바꾸며 80개 반복 p-value를 관찰합니다.
같은 설정으로 반복한 80개 p-value
첫 표본과 반복 결과
H0가 참이어도 일부 표본은 α=.05에서 거짓 양성을 만듭니다.
교육용 one-sample z test: μ0=10 · known σ=3 · α=.05 · 정규 독립표집 · simulator_version: u07-ztest-guided-v1. 실제 연구에서는 알려지지 않은 σ, 설계 구조, 검정 가정, 다중성 등을 반영한 방법을 선택해야 합니다.
80回中正確に4回がp<.05になる必要はありません。α=.05は各batchへの5%割当ではなく、同手順を長期反復した誤り率です。
p-valueが小さくなる三経路を分けます
- 観測効果が大きいと検定統計量が増え得ます。
- 散らばりが小さいと同じ効果が明瞭になります。
- 独立nが大きいと標準誤差が減り、非常に小さい効果も低いp-valueを作れます。
したがって大標本のp<.001でも実験上些細な効果かもしれず、小さな探索研究のp=.08でも重要効果を排除したとは言えません。どちらも効果量とCIを読みます。
JMP出力は証拠の要素を分けて示します
JMP報告名は分析構造で違いますが、核心は検定統計量、p-value、H1、効果、信頼区間の関係です。
효과를 표준오차와 비교해 H0 기준 척도로 옮긴 값입니다.
선택한 양측·단측 H1에 맞는 꼬리확률을 읽습니다.
차이의 방향·크기와 양립 가능한 범위를 p-value와 함께 봅니다.
両側t検定のProb > |t|のように出力名が裾を示すことがあります。片側p-valueでは符号と事前H1方向の一致を確認し、最小に見えるp-valueを事後選択しません。
統計ソフトは、各行が正しい独立実験単位か、仮定と標本選択が妥当か、多数の結果から有利な分析だけを選んでいないか、効果が生物学的・臨床的・品質的に重要か、新実験で再現するかを保証しません。
棄却か否かより豊かに報告します
悪い文:
p<.05なので改善工程には効果がある。
より良い文:
独立batchの事前指定両側分析で平均収率差B−Aは1.3 percentage points、95% CIは−1.8–4.4、p=.39だった。この標本ではH0を棄却できず、改善効果なしや工程同等性を示す根拠ではない。
分析法、独立n、効果単位、CI、正確なp-value、方向、事前指定の有無を残します。p-valueは一文字の結論ではなく証拠文の一部です。
終了前に確認する七文
- H0は効果なしの基準モデル、H1は研究方向を含みます。
- 検定統計量は観測効果を標準誤差に照らしH0尺度へ変えます。
- p-valueはH0とモデル下で観測以上に極端な結果の確率です。
- p-valueはH0が真の確率でも効果量でもありません。
- p≥αではH0を採択せず、棄却できません。
- αは真のH0下の第一種過誤基準で、データ前に定めます。
- 棄却判断は効果量、CI、設計、実質的意味を代行しません。
次単元では二群平均比較の前に散らばりは同じかを問います。等分散仮定と、分散検定一つで分析法を機械的に分けてはいけない理由を学びます。
公式補足資料
- NIST/SEMATECH · Critical values and p-values
- NIST/SEMATECH · Statistical tests
- ASA · Statement on Statistical Significance and P-Values
- JMP Statistics Knowledge Portal · Hypothesis Testing
この記事の数値、図、In-Silico Labは統計概念を説明する合成資料です。実研究・臨床・品質・規制判断の根拠には使えません。