昨日、独立に準備した8試料の平均応答値は9.6でした。今日、同じ条件を目指して新しい8試料を準備すると平均は10.7でした。プロトコルも測定項目も同じなのに数が違います。どちらかが誤りでしょうか。
そうとは言えません。昨日と今日は同じ試料ではなく、異なる独立単位で構成された二つの標本です。同じ母集団を目指しても、含まれる単位が変われば観測値と平均も変わり得ます。
同じ母集団から取ったのに、なぜ標本結果は毎回変わるのか。
前単元では一標本を平均、標準偏差、分布、元データ点、反復構造から読みました。今度は、その標本自体が再実験で変わり得ることを見ます。
まず問いの境界を定めます
「実験の平均はいくつか」は、どの細胞、donor、時点、培養条件を指すか定めるまで不完全です。研究質問が最終的に指す全対象が母集団です。
母集団は目の前の巨大名簿とは限りません。指定した凍結試料全体のような有限集合でも、同じ条件で将来独立に準備したときに結果を生む生成過程でもかまいません。重要なのは、どこまでを同じ問いに含めるかを文で定義することです。
標本は母集団を知るため実際に観測した一部の独立単位です。今日の独立culture 8個が一標本なら、明日の新しい8個は同じ母集団を狙う別標本です。
標本は母集団の一部ですが、自動的に完全な縮図にはなりません。便利な試料だけを選ぶ、特定donor・日・装置に偏る場合、行数が多くても問い全体を表さないことがあります。標本サイズは重要ですが、どこからどう得たかの代わりにはなりません。
実際に入手できる試料範囲が研究質問の母集団より狭いことがあります。統計ソフトは入力値を正確に計算しても、より広い対象へ一般化できるかは判断しません。
母集団の数と標本の数は名前も違います
母集団全体の数値的性質が母数です。母平均をμ、母標準偏差をσと書きます。手元の標本から計算した値は統計量で、標本平均はx̄、標本標準偏差はsです。
정의한 모집단이 가진 평균
이번 표본에서 계산한 평균
모집단 값들의 퍼짐
이번 표본 값들의 퍼짐
記号は、知りたいものと実際に計算したものを分ける安全境界です。母集団全体を観測できないことが多いためμとσを直接知ることはできず、x̄とsから学びます。
ソフトがMean = 10.274と精密に表示しても、入力標本のx̄です。小数桁が多くてもμの直接観測にはなりません。新標本ではx̄もsも変わります。
同じ母集団で平均が違うのはなぜでしょうか
教育用の小さな有限母集団を使います。
6, 8, 10, 12, 14
母平均は10です。二個ずつ取ります。
| 標本 | 抽出値 | 標本平均 x̄ | 解釈 |
|---|---|---|---|
| A | 6, 8 | 7 | μより低いが可能な標本 |
| B | 8, 12 | 10 | 偶然μと同じ標本 |
| C | 12, 14 | 13 | μより高いが可能な標本 |
三標本は同じ母集団から来ても平均は7、10、13です。Bだけが成功ではありません。入った単位が違うため平均も違います。
同じ母集団と抽出規則を保ち、新しい独立単位で標本を繰り返し作る思考実験が反復標本抽出です。標本ごとに構成と統計量が変わる現象が標本抽出変動です。
標本抽出変動は何も信じられないという意味ではありません。一結果がどれほど動き得るかを研究対象にし、一標本の数を固定された真実にしない姿勢です。
二標本平均の差だけで工程変化、装置誤差、生物学的差を確定できません。標本抽出変動だけでも差は生じます。設計、batch、day、donor、装置記録、差の大きさを合わせて調べます。
もう一つの分布が現れます
前単元のヒストグラムの一点は一実験単位の観測値で、元データの分布でした。今度は同じ大きさの標本を繰り返し、各x̄を一点として残します。これが標本平均の標本分布です。
- 元データ分布の一点: 一つの独立実験単位からの観測値
- 標本分布の一点: 一標本全体を要約した統計量x̄
常に「何の分布か」まで言います。平均と中央値では別の標本分布が生じ、この単元は標本平均だけを追います。
独立標本サイズが増えると何が変わるでしょうか
4個ずつの平均と25個ずつの平均を比べます。小標本では偶然入った数個の低値・高値が平均を大きく動かします。大標本では多くの値が入り、個別の偶然効果が互いに和らぐ傾向があります。
同じ生成過程と正しい独立抽出なら、大きいnの平均は概してμ周辺に狭く集まります。ただし、(1) 一回の大標本x̄がμと正確に一致する保証はない、(2) 偏った源から数を増やしても偏りは消えない、(3) 同一生物試料の技術反復は独立nを増やさない、という境界があります。
標本平均の揺れを数にする標準誤差と区間にする信頼区間は次単元で扱います。今はnにより平均点の雲の幅が変わる様子を読めば十分です。
「もう一度した」の意味を正確にします
一cultureからtechnical wellを4回読む場合と独立cultureを4個新しく準備する場合は、どちらも4行になります。前者は一生物単位内の技術反復、後者は母集団からの新しい独立単位です。
技術反復は分注・読取りなど測定過程の揺れを調べる有用なデータです。しかし同じ試料を多く読んでも新しい生物学的情報を4回得たことにはなりません。反復標本抽出を言うなら、どの新しい独立実験単位が入ったかを説明します。
標本を自分で引き直しましょう
mini Labは母平均μ=10、母標準偏差σ=3の対称連続生成過程を使います。実データではなく反復標本抽出を見る合成モデルです。
n=8でNew sampleを繰り返します。μは10のままx̄とsが変わります。次にn=4と25で平均点履歴の幅を比べます。
처음이라면: 무엇을 눌러야 하나요?
- 1. 질문을 먼저 읽기Lab 제목에서 이번에 비교할 한 가지를 확인합니다.
- 2. 조건 하나만 바꾸기처음에는 n, 효과, 산포 같은 입력 중 하나만 바꾸십시오.
- 3. New sample 누르기새 합성 데이터가 만들어집니다. 같은 조건도 표본에 따라 달라질 수 있습니다.
- 4. 現在の標本と反復平均の履歴 비교하기바꾸기 전후 무엇이 움직이고 무엇이 그대로인지 한 문장으로 적어보십시오.
막히면 초기화로 돌아가 기본 결과를 본 뒤 조건 하나만 바꾸십시오. 이 Lab은 정답 판정기가 아니라 패턴 관찰 도구입니다.
같은 모집단에서 새 표본을 뽑아보세요
모집단 평균 10, 모집단 표준편차 3인 교육용 생성 과정을 고정합니다. seed와 독립 n만 바꾸며 이번 표본의 평균과 반복 평균들의 흔적을 비교합니다.
현재 표본의 원자료점
같은 설정으로 만든 24개 표본평균
이번 실행의 구분
이번 x̄가 10과 다르더라도 정상입니다. 설정한 μ는 생성 과정의 중심이고 x̄는 이번에 뽑힌 표본의 계산값입니다.
같은 40회 반복: n=4와 n=25의 표본평균 흔적
모형: 대칭 연속형 정규 생성 과정, μ=10, σ=3 · PRNG: mulberry32 · 변환: Box–Muller · simulator_version: u04-guided-v1. 이 Lab은 개념 학습용이며 실제 연구·품질·임상 판단에 사용할 수 없습니다.
seedは疑似乱数を再現する開始値です。同じsimulator version、母集団設定、n、seedなら同じ合成標本になります。これは計算再現性であり、実細胞実験の生物学的再現性を保証しません。
コピー表の一行は新しく抽出した独立実験単位です。本文と数が違っても正常です。x̄はμと完全一致しない、seedで標本と統計量が変わる、大きいnの平均点は概して狭く集まる、という関係を確認します。
JMPはこの現象をどう表すでしょうか
JMPは有効な標本設計を代行しません。入力標本を要約し、反復実行で集めた統計量列を図示します。
현재 표본의 원자료 모양과 Mean·Std Dev·N을 보여줍니다.
새 표본을 넣을 때 x̄와 s가 어떻게 달라지는지 비교합니다.
반복 실행에서 모은 x̄ 값들의 위치와 흔들림을 표현합니다.
現在標本のJMP DistributionではMeanがx̄、Std Devがs、Nが入力行数です。Nが独立実験単位数かは研究者が確認します。同一cultureの技術反復4行を見てJMPが独立n=1へ直すことはありません。
新標本ごとにx̄とsは変わります。sample_id, seed, n, sample_meanを集めた台帳なら、sample_mean列のDistributionが標本平均の位置と揺れ、すなわち標本平均の標本分布を表します。
- 現在標本のMeanは母数μではなく統計量x̄です。
- 新標本ではMeanとStd Devが変わり得ます。
- 標本平均列の各行は異なる一標本全体を要約します。
- ソフト出力は母集団定義、偏りのない抽出、独立性を保証しません。
図とLabだけで概念を学べます。利用できる場合は現在標本と標本平均台帳を読み込み、現在標本の要約と反復統計量の分布を区別してください。
一回の平均で止まらないための五問
- 対象母集団はどこまでか。 対象、条件、時点、独立単位を定義します。
- 手元は母集団全体か標本か。 観測範囲と対象範囲を分けます。
- 画面の数は母数か統計量か。 標本計算ならx̄とsです。
- 新しく抽出した独立単位は何か。 技術反復を新しい生物標本に数えません。
- 引き直すと統計量はどう揺れるか。 一結果を固定真実にしません。
標本抽出変動は厄介な例外ではなく、標本から母集団を学ぶと必ず現れる構造です。これを認めて初めて、観測x̄の周りにμがあり得る範囲をどう表すかという次の問いへ進めます。
次単元では一標本平均の横に不確実性の範囲を置きます。標準誤差、標本ごとに動く信頼区間、95%の反復標本抽出的意味をつなぎます。
公式補足資料
- JMP Statistics Knowledge Portal · Descriptive Statistics
- JMP Statistics Knowledge Portal · Inferential Statistics
- JMP Academic · Probability and Sampling Distributions
- JMP Help · Distributions of Continuous Variables
この記事の数値、図、In-Silico Labは統計概念を説明するための合成資料です。実研究・臨床・品質・規制判断の根拠には使えません。