「サンプルは3つでよいのか、30必要なのか」。実験の種類だけで決まる魔法の答えはありません。見逃せない効果、値のばらつき、受け入れる誤りを知る必要があります。
この単元の問いは一つです。
望む結論に必要な情報量を、実験の前にどう計画するか。
四つの量は一つの関係で結ばれます
平均比較の単純な計画で重要なのは次です。
- 効果
Δ: 検出したい、実質的に意味のある最小差 - ばらつき
σ: 独立な実験単位で予想される SD - 有意水準
α: H0 が真のときに受け入れる第1種誤り - 検出力
1−β: 指定した真の Δ を検出する確率
このうち三つと解析構造を定めれば必要な n を計算できます。効果が小さく、ばらつきが大きいほど信号雑音比 Δ/σ が小さくなり、より多くの n が必要です。α を厳しくしたり目標 power を高くしたりしても n は増えます。
二つの独立群への等配分と既知の σ を仮定する正規近似では、群当たり n はおおよそ (σ/Δ)² に比例します。Δ を半分にすると n は約4倍です。「もう少し小さな差も見たい」が大きな費用になる理由です。
最小検出差は過去の標本で観察した差ではありません
計画上の Δ は、研究として見逃してはならない最小効果です。パイロットで偶然大きく出た差をそのまま使うと n を過小計画することがあります。先行研究、工程許容値、臨床的重要性、測定単位、意思決定の費用で正当化します。
σ にも不確実性があります。小さなパイロットの SD は大きく揺れ、選ばれた条件では小さく見えることがあります。保守的な上限、外部データ、盲検化された内部パイロット、感度表を用い、複数の σ に対する n を示す方がよいでしょう。
同じデータの観測効果を入れて計算する post hoc power は、p 値とほぼ同じ情報を言い換えたものです。非有意結果を説明するには、事前計画、CI の幅、検出可能な効果、実際に得た情報量を報告してください。
power は効果ごとに異なる曲線です
標本サイズ一つに power が一つ付くわけではありません。効果が0なら、適切に較正された α 水準検定の棄却率は α 付近であり、効果が大きくなるほど power は上がります。power curve は「この n でどの効果をどの程度見つけられるか」を示します。
片側検定は事前に定めた方向ではより高い power を持ち得ますが、反対方向は検定しません。データを見た後で n を減らしたり p 値を小さくしたりするために片側へ変更することは許されません。
In-Silico Lab: 計画した n の感度を見る
Lab は、二つの独立群、両側 α=.05、等しい n、既知の共通 SD を仮定した正規近似を使います。
- Δ を2から .5 に下げ、群当たり n がどれほど増えるか見ます。
- SD を2から4に上げ、二乗の関係を確認します。
- power 80%、90%、95% の費用を比べます。
- 計算値を実研究の n に確定する前に、抜けている設計要素を書き出します。
効果・散布・検定力で独立nを計画する
2 つの独立集団、両側 α = .05、等倍の正規近似を透明に計算します。これは開始値であり、すべての設計に代わる答えではありません。
初めての場合:何を押すべきですか?
- 1.質問を最初に読むLabタイトルで今回比較する1つを確認してください。
- 2.条件を1つだけ変更する最初は、n、効果、散布などの入力の1つだけを変更します。
- 3. 新しい合成サンプル 押す新しい合成データが作成されます。同じ条件も標本によって変わり得る。
- 4. 図と計算結果 比較する変更の前後に何が動いて、何がそのままであるかを一文で書き留めてください。
詰まったら初期化に戻り、デフォルトの結果を見た後、条件を1つだけ置き換えます。このLabは正解判定器ではなく、パターン観察ツールです。
同じ設定の合成観測
計算結果
脱落率を加えることと群集・繰り返し測定の設計効果を反映することは別途のステップです。事後観測効果でパワーを再計算してp値を繰り返し説明しないでください。
教育用 synthetic model ·bjs-comparison-sequence-v1。実際の研究判断には、実験単位、欠測、分布、多重性、事前計画とドメイン基準を別々に反映しなければなりません。
現実の標本サイズは単純な公式より大きくなります
次の事項には別の補正、シミュレーション、専門モデルが必要になることがあります。
- 予想される脱落、解析除外、測定失敗
- 不均衡配分と費用差
- donor 内の well、施設内の患者などのクラスター設計効果
- 反復測定相関と paired SD
- 複数 endpoint、中間解析、多重比較
- 非劣性、同等性、生存、比率など別の estimand
- 整数の block size と最小 batch 数
脱落率10%なら、単に n×1.10 とするのではなく、解析に残るべき n を基準に n/(1−0.10) のように増やします。クラスター化データでは個体数と cluster 数の両方が重要で、well を増やしても donor レベルの情報の代わりにはなりません。
JMP 出力では入力仮定も結果の一部です
効果・SD・α・検定力のうち知っている値をもとに残りを計算します。
効果が変わると検出確率が連続的に変わる様子を見ます。
独立n、黒方向、配分比、およびアッセイは計画と一致する必要があります。
結果のスクリーンショットだけを残さないでください。解析法、両側/片側、Δ、SD、α、power、配分比、計算した n の単位、ソフトウェア版を記録します。通常は切り上げ、必要な block または pair 構造を満たすように調整します。
計画文の例
主要 endpoint は day 7 viability の donor 平均差とした。最小検出差 5 percentage points、donor 間 SD 8、両側 α=.05、power 90%、1:1 配分で、群当たり55 donor を計画した。解析不能10%を考慮し、群当たり62 donor を募集する。well の技術反復は測定精度のために用いるが、独立 n には含めない。
この単元の要点
- 十分な n は効果、ばらつき、α、power、解析構造の関数です。
- Δ は科学的に見逃せない事前の効果です。
- σ の不確実性を感度分析に反映します。
- power は効果に対する曲線です。
- 観測効果に基づく事後 power で結果を再解釈しません。
- 脱落、クラスター、反復、多重性を実務計画に加えます。
次の単元からは群差から二つの連続変数の関係へ進みます。相関係数より先に散布図を読みましょう。
公式補足資料
この Lab の n は教育用の正規近似です。実際の研究計画は、その設計と適用される要件に照らして検討してください。