昨日、独立に準備した8試料の平均応答値は9.6でした。今日、同じ条件を目指して新しい8試料を準備すると平均は10.7でした。プロトコルも測定項目も同じなのに数が違います。どちらかが誤りでしょうか。
そうとは言えません。昨日と今日は同じ試料ではなく、異なる独立単位で構成された二つの標本です。同じ母集団を目指しても、含まれる単位が変われば観測値と平均も変わり得ます。
同じ母集団から取ったのに、なぜ標本結果は毎回変わるのか。
前単元では一標本を平均、標準偏差、分布、元データ点、反復構造から読みました。今度は、その標本自体が再実験で変わり得ることを見ます。
まず問いの境界を定めます
「実験の平均はいくつか」は、どの細胞、donor、時点、培養条件を指すか定めるまで不完全です。研究質問が最終的に指す全対象が母集団です。
母集団は目の前の巨大名簿とは限りません。指定した凍結試料全体のような有限集合でも、同じ条件で将来独立に準備したときに結果を生む生成過程でもかまいません。重要なのは、どこまでを同じ問いに含めるかを文で定義することです。
標本は母集団を知るため実際に観測した一部の独立単位です。今日の独立culture 8個が一標本なら、明日の新しい8個は同じ母集団を狙う別標本です。
標本は母集団の一部ですが、自動的に完全な縮図にはなりません。便利な試料だけを選ぶ、特定donor・日・装置に偏る場合、行数が多くても問い全体を表さないことがあります。標本サイズは重要ですが、どこからどう得たかの代わりにはなりません。
実際に入手できる試料範囲が研究質問の母集団より狭いことがあります。統計ソフトは入力値を正確に計算しても、より広い対象へ一般化できるかは判断しません。
母集団の数と標本の数は名前も違います
母集団全体の数値的性質が母数です。母平均をμ、母標準偏差をσと書きます。手元の標本から計算した値は統計量で、標本平均はx̄、標本標準偏差はsです。
定義した母集団が持つ平均
今回のサンプルで計算した平均
母集団値の広がり
今回のサンプル値の広がり
記号は、知りたいものと実際に計算したものを分ける安全境界です。母集団全体を観測できないことが多いためμとσを直接知ることはできず、x̄とsから学びます。
ソフトがMean = 10.274と精密に表示しても、入力標本のx̄です。小数桁が多くてもμの直接観測にはなりません。新標本ではx̄もsも変わります。
同じ母集団で平均が違うのはなぜでしょうか
教育用の小さな有限母集団を使います。
6, 8, 10, 12, 14
母平均は10です。二個ずつ取ります。
| 標本 | 抽出値 | 標本平均 x̄ | 解釈 |
|---|---|---|---|
| A | 6, 8 | 7 | μより低いが可能な標本 |
| B | 8, 12 | 10 | 偶然μと同じ標本 |
| C | 12, 14 | 13 | μより高いが可能な標本 |
三標本は同じ母集団から来ても平均は7、10、13です。Bだけが成功ではありません。入った単位が違うため平均も違います。
同じ母集団と抽出規則を保ち、新しい独立単位で標本を繰り返し作る思考実験が反復標本抽出です。標本ごとに構成と統計量が変わる現象が標本抽出変動です。
標本抽出変動は何も信じられないという意味ではありません。一結果がどれほど動き得るかを研究対象にし、一標本の数を固定された真実にしない姿勢です。
二標本平均の差だけで工程変化、装置誤差、生物学的差を確定できません。標本抽出変動だけでも差は生じます。設計、batch、day、donor、装置記録、差の大きさを合わせて調べます。
もう一つの分布が現れます
前単元のヒストグラムの一点は一実験単位の観測値で、元データの分布でした。今度は同じ大きさの標本を繰り返し、各x̄を一点として残します。これが標本平均の標本分布です。
- 元データ分布の一点: 一つの独立実験単位からの観測値
- 標本分布の一点: 一標本全体を要約した統計量x̄
常に「何の分布か」まで言います。平均と中央値では別の標本分布が生じ、この単元は標本平均だけを追います。
独立標本サイズが増えると何が変わるでしょうか
4個ずつの平均と25個ずつの平均を比べます。小標本では偶然入った数個の低値・高値が平均を大きく動かします。大標本では多くの値が入り、個別の偶然効果が互いに和らぐ傾向があります。
同じ生成過程と正しい独立抽出なら、大きいnの平均は概してμ周辺に狭く集まります。ただし、(1) 一回の大標本x̄がμと正確に一致する保証はない、(2) 偏った源から数を増やしても偏りは消えない、(3) 同一生物試料の技術反復は独立nを増やさない、という境界があります。
標本平均の揺れを数にする標準誤差と区間にする信頼区間は次単元で扱います。今はnにより平均点の雲の幅が変わる様子を読めば十分です。
「もう一度した」の意味を正確にします
一cultureからtechnical wellを4回読む場合と独立cultureを4個新しく準備する場合は、どちらも4行になります。前者は一生物単位内の技術反復、後者は母集団からの新しい独立単位です。
技術反復は分注・読取りなど測定過程の揺れを調べる有用なデータです。しかし同じ試料を多く読んでも新しい生物学的情報を4回得たことにはなりません。反復標本抽出を言うなら、どの新しい独立実験単位が入ったかを説明します。
標本を自分で引き直しましょう
mini Labは母平均μ=10、母標準偏差σ=3の対称連続生成過程を使います。実データではなく反復標本抽出を見る合成モデルです。
n=8でNew sampleを繰り返します。μは10のままx̄とsが変わります。次にn=4と25で平均点履歴の幅を比べます。
初めての場合:何を押すべきですか?
- 1.質問を最初に読むLabタイトルで今回比較する1つを確認してください。
- 2.条件を1つだけ変更する最初は、n、効果、散布などの入力の1つだけを変更します。
- 3. New sample 押す新しい合成データが作成されます。同じ条件も標本によって変わり得る。
- 4. 現在の標本と反復平均の履歴 比較する変更の前後に何が動いて、何がそのままであるかを一文で書き留めてください。
詰まったら初期化に戻り、デフォルトの結果を見た後、条件を1つだけ置き換えます。このLabは正解判定器ではなく、パターン観察ツールです。
同じ母集団から新しい標本を選んでください。
母集団平均10、母集団標準偏差3人の教育用生成プロセスを固定します。シードと独立nのみを変更し、このサンプルの平均と繰り返し平均のトレースを比較します。
現在のサンプルの原料店
同じ設定で作成した24個のサンプル平均
今回の実行の区分
今回のx̄が10と違っても正常です。設定したμは生成過程の中心で、x̄は今回選んだサンプルの計算値です。
同じ40回の繰り返し:n = 4とn = 25のサンプル平均トレース
モデル:対称連続型正規生成プロセス、μ=10、σ=3・PRNG:mulberry32・変換:Box–Muller・simulator_version:u04-guided-v1。このLabは概念学習用であり、実際の研究・品質・臨床判断には使用できません。
seedは疑似乱数を再現する開始値です。同じsimulator version、母集団設定、n、seedなら同じ合成標本になります。これは計算再現性であり、実細胞実験の生物学的再現性を保証しません。
コピー表の一行は新しく抽出した独立実験単位です。本文と数が違っても正常です。x̄はμと完全一致しない、seedで標本と統計量が変わる、大きいnの平均点は概して狭く集まる、という関係を確認します。
JMPはこの現象をどう表すでしょうか
JMPは有効な標本設計を代行しません。入力標本を要約し、反復実行で集めた統計量列を図示します。
現在のサンプルの原料形状とMean・Std Dev・Nを示します。
新しいサンプルを入れるときにx̄とsがどのように異なるかを比較します。
繰り返し実行で収集されたx値の位置と揺れを表します。
現在標本のJMP DistributionではMeanがx̄、Std Devがs、Nが入力行数です。Nが独立実験単位数かは研究者が確認します。同一cultureの技術反復4行を見てJMPが独立n=1へ直すことはありません。
新標本ごとにx̄とsは変わります。sample_id, seed, n, sample_meanを集めた台帳なら、sample_mean列のDistributionが標本平均の位置と揺れ、すなわち標本平均の標本分布を表します。
- 現在標本のMeanは母数μではなく統計量x̄です。
- 新標本ではMeanとStd Devが変わり得ます。
- 標本平均列の各行は異なる一標本全体を要約します。
- ソフト出力は母集団定義、偏りのない抽出、独立性を保証しません。
図とLabだけで概念を学べます。利用できる場合は現在標本と標本平均台帳を読み込み、現在標本の要約と反復統計量の分布を区別してください。
一回の平均で止まらないための五問
- 対象母集団はどこまでか。 対象、条件、時点、独立単位を定義します。
- 手元は母集団全体か標本か。 観測範囲と対象範囲を分けます。
- 画面の数は母数か統計量か。 標本計算ならx̄とsです。
- 新しく抽出した独立単位は何か。 技術反復を新しい生物標本に数えません。
- 引き直すと統計量はどう揺れるか。 一結果を固定真実にしません。
標本抽出変動は厄介な例外ではなく、標本から母集団を学ぶと必ず現れる構造です。これを認めて初めて、観測x̄の周りにμがあり得る範囲をどう表すかという次の問いへ進めます。
次単元では一標本平均の横に不確実性の範囲を置きます。標準誤差、標本ごとに動く信頼区間、95%の反復標本抽出的意味をつなぎます。
公式補足資料
- JMP Statistics Knowledge Portal · Descriptive Statistics
- JMP Statistics Knowledge Portal · Inferential Statistics
- JMP Academic · Probability and Sampling Distributions
- JMP Help · Distributions of Continuous Variables
この記事の数値、図、In-Silico Labは統計概念を説明するための合成資料です。実研究・臨床・品質・規制判断の根拠には使えません。