処理AとBを別々のbatchへ適用する実験と、同じdonorの細胞を二つに分けてAとBを適用する実験は、どちらも二列の数を作ります。しかし二解析の誤差単位は同じではありません。
この単元の問いは一つです。
独立・対応、等分散・不等分散、正規・非正規を、なぜデータ構造から先に区別すべきか。
独立と対応は表の形でなく生成関係です
独立標本では、Aの一観測とBの特定観測に自然な対応はありません。異なるdonor、batch、animal、独立培養が例です。平均差のSEは二群の変動を一緒に反映します。
対応標本では、同じ実験単位の前後、左右、matched pairのように二値が一組になります。解析対象は二つの元データ列ではなく、ペア差 dᵢ=Bᵢ−Aᵢ です。個体ごとの大きなbaseline差も、ペア内では相殺できます。
ペアはデータ後に似た行をつないで作るものではなく、設計で決めます。逆に本当のペア情報を捨てて独立解析をすれば、有用な情報と検出力を失うことがあります。
独立二平均には少なくとも二つの標準誤差モデルがあります
平均差 x̄B−x̄A が同じでもSE計算は違います。
pooled tは二母分散が等しい仮定の下で二標本分散を一つに合成します。Welch tは sA²/nA + sB²/nB を使い、群別の分散とnを別に反映し、その不確実性に合わせて自由度を調整します。
群サイズが同程度でばらつきも似れば結果はほぼ同じになり得ます。nと分散が同時に大きく異なればpooled結果は歪み得ます。分析計画でWelchを頑健な基本値にできますが、分散検定p値を見て毎回変える自動手順は避けます。
一donorから得た12 wellを独立donor 12人のように解析すると、nと自由度が膨らみます。技術反復をdonor一行へ平均するか、階層モデルで構造を表します。どのt-testを選ぶかより先に実験単位を正しく数えます。
paired t-testは「二群検定」より一標本の差検定に近いです
ペア差の平均 d̄、SD s_d、ペア数nで t=d̄/(s_d/√n) を計算します。仮定も各条件元データの正規性より、差値の分布とペアの独立性に焦点があります。
一部ペアの片側値が欠ければcomplete pairs数が減ります。欠測原因が処理や応答と関係するならcomplete caseだけを残すことはバイアスになり得るため、欠測構造を報告し適切なモデルを計画します。
非パラメトリックは「仮定のない平均検定」ではありません
Mann–Whitney/Wilcoxon rank-sumは順位を使いますが、一般に平均差を直接検定しません。分布形が同じで位置だけが動く条件なら位置差として解釈しやすくなります。paired Wilcoxon signed-rankにも差の対称性など解釈条件があります。
極端値があるからと自動でrank testへ変えません。外れ値の原因、問いが平均か中心位置か、検出限界・順序尺度かを先に確認します。permutation、bootstrap、頑健推定、明示的モデルも候補です。
In-Silico Lab: 同じ効果を二構造で解析します
independentでSD比を変え、Welch SEとpooled SEを比べます。pairedで同じbaselineを共有するとき、ペア差SEがどう減るか見ます。- 効果0でseedを変え、どちらの構造でも偽陽性が起こり得ることを確認します。
- ペアを任意に並べ替えたらpairedの利点が残るか考えます。
独立と対応は同じ数字の2列ではありません
独立集団のウェルチ比較と同じ単位前後のペア別の差を変えて、標準誤差が作られる構造を比較します。
初めての場合:何を押すべきですか?
- 1.質問を最初に読むLabタイトルで今回比較する1つを確認してください。
- 2.条件を1つだけ変更する最初は、n、効果、散布などの入力の1つだけを変更します。
- 3. 新しい合成サンプル 押す新しい合成データが作成されます。同じ条件も標本によって変わり得る。
- 4. 図と計算結果 比較する変更の前後に何が動いて、何がそのままであるかを一文で書き留めてください。
詰まったら初期化に戻り、デフォルトの結果を見た後、条件を1つだけ置き換えます。このLabは正解判定器ではなく、パターン観察ツールです。
同じ設定の合成観測
計算結果
対応は、共有されたオブジェクトの違いをペア内で削除します。ランダムに行を合わせると、この利点は偽です。
教育用 synthetic model ·bjs-comparison-sequence-v1。実際の研究判断には、実験単位、欠測、分布、多重性、事前計画とドメイン基準を別々に反映しなければなりません。
Labのz近似は関係を見えやすくするためのものです。実際のt手順では標本SD、自由度、不均衡n、欠測を反映します。
JMPの結果名はモデル仮定を示します
仮定が異なる二つの推定量の差・SE・CIを区分します。
ペアの違いを集団データのように分析します。
ランキングベースの結果も位置・分布の質問と仮定を確認します。
Assuming equal variancesとAssuming unequal variancesは同じ結果の飾りではありません。どのSEと自由度を使ったかを示します。Matched Pairsは行の接続を事前に正しく定義して初めて意味を持ちます。プログラムはwell IDがdonor IDかを知りません。
分析選択を問いの順で整理します
- 応答は連続型で、平均差が研究の問いか。
- 独立実験単位は何で、各行はその単位を表すか。
- 二値は設計上対応しているか。
- 分布形、外れ値、打ち切り、ばらつき不均衡はどうか。
- 事前解析法と感度分析は何か。
- 効果、CI、単位をどう報告するか。
結果文の例
異なるdonorから得たA(n=18)とB(n=17)を独立に比較した。平均差B−Aは1.7 percentage pointsで、Welch 95% CIは0.2–3.2、t(29.4)=2.31、p=.028だった。donorごと一値を分析単位とし、分布図と頑健位置推定でも方向は同じだった。
対応設計なら「完全ペアn」、平均ペア差、差のSDを書き、単に「二群t-test」とは書きません。
この単元の要点
- 独立と対応は設計が決める関係です。
- Welchは群別の分散とnを別に反映します。
- pooled/Welchを一つのばらつき事前検定で自動分岐しません。
- 対応解析の資料はペア差です。
- rank testは仮定のない平均検定ではありません。
- 技術反復を独立実験単位として数えません。
次の単元では二群を三群以上へ広げます。反復t-testが作る多重エラーを、ANOVAの変動分解で扱います。
公式補足資料
この記事の数値・図・Labは教育用の合成資料です。