実験AとBの平均応答値がどちらも10だとします。報告書に平均しかなければ同じ結果に見えます。しかしAが10の周りに密集し、Bが2から18まで広がっていたら、本当に同じ結果でしょうか。
平均が同じなら、二つのデータも同じか。
答えはいいえです。平均は中心を有用に要約しますが、中心からの距離、長い裾、異なる群の混在までは示しません。平均が役に立たないのではなく、平均が語ることと語れないことを区別する必要があります。
最初から全用語を覚える必要はありません。下の五語を羅針盤にし、図で必要になった言葉を一つずつ加えましょう。
計算より先に確認すること: 一行は何を表すか
平均や標準偏差を計算する前に、表の一行が何を意味するか確認します。異なる三つの培養wellを一回ずつ測る場合も、一つのwellを同じ装置で三回読む場合も三行になりますが、同じ証拠ではありません。
実験単位は処置が独立に適用される最小単位です。異なる実験単位から得た反復が生物学的反復、同じ単位の反復測定が技術反復です。計算表では技術反復を明示した規則で整理し、独立実験単位一つを一行にします。
平均が完全に同じ二組
各値を一つの生物学的実験単位の相対応答とします。AとBは研究データではなく教育用の合成値です。
| 組 | 観測値 | 平均 | 中央値 | 標本分散 | 標本標準偏差 |
|---|---|---|---|---|---|
| A | 8, 9, 10, 11, 12 | 10 | 10 | 2.5 | 1.58 |
| B | 2, 6, 10, 14, 18 | 10 | 10 | 40 | 6.32 |
平均は合計を個数で割った値です。AもBも合計50、五個なので平均10です。この速い中心の要約は点間距離を一数に圧縮するため、中心の横に散らばりが必要です。
点と平均の距離を数に変える
各観測値から平均を引いた値が偏差です。Aは−2, −1, 0, 1, 2、Bは−8, −4, 0, 4, 8で、Bの方が明らかに広いです。偏差をそのまま足すと左右が相殺され、どちらも0になります。距離を残すため偏差を二乗し、遠い点ほど大きな重みを持たせます。
なぜnではなくn−1で割るのでしょうか
標本自身の平均を中心にすると、未知の母集団中心を基準にした場合より散らばりを小さく見積もる傾向があります。標本平均がその標本に最も近い中心として既に当てはめられているためです。標本分散でn−1を使うのは、この傾向を補正するためです。
n−1の証明は自由度と期待値を扱う後の段階に属します。今は、標本から中心を一つ推定したため独立な距離情報がn−1個残る、という直観で十分です。
Aの標本標準偏差は約1.58、Bは約6.32です。同じ平均でもBの典型的な広がりは大きいです。ただし小さい標準偏差が必ず良い実験を意味しません。検出限界、依存した技術反復、狭く選んだ試料範囲でも小さい散らばりは生じます。
平均と標準偏差だけでも形は全部見えません
中心と散らばりを一緒に見ても全体の形は残ります。値が中心の両側に釣り合う場合、右に長い裾を持つ場合、二群に見える場合があります。この形が分布です。
二つの山が見えても、二種類の細胞が混ざったとは証明できません。batch、処置時点、装置状態、隠れた下位群の可能性もありますが、小標本やbinの選び方が作った形かもしれません。グラフは原因への判決ではなく、次に確認する問いの地図です。
二群で同じx軸範囲とbin境界を使います。小標本ではbinの小さな変更で形が大きく変わるため、ヒストグラムと元データ点を一緒に確認します。
中央値と箱ひげ図は何を加えるでしょうか
中央値は値を並べた中央の値で、遠い極端値に平均ほど引かれません。Q1とQ3は25%と75%の位置、その差のIQRは中央50%が占める幅です。
箱ひげ図はこの順序情報を圧縮します。箱の両端がQ1とQ3、箱内の線が中央値です。ひげは通常範囲の端を示し、外側の点は外れ値候補として表示されることがあります。
まず試料ID、元記録、単位、装置ログ、時点、実験条件を確認します。誤りが確認されたら事前規則と根拠に従い、有効な観測なら安易に除きません。除外前後で結論がどう変わるかも記録します。
同じ平均を自分で作ってみましょう
ここまでは著者が選んだ値でした。実際の標本は毎回同じになりません。下のmini LabでBの散らばりと形を変えてください。教育のため両群の平均を正確に10に固定しているので、これは無作為標本ではなく構成された比較データです。
평균 10을 고정하고, B의 모양을 바꿔보세요
기준 비교에서는 평균을 고정해 산포와 모양의 차이에 집중합니다. 아래 데이터는 연구 결과가 아니라 통계 개념을 관찰하도록 구성한 교육용 합성 데이터입니다.
처음이라면: 무엇을 눌러야 하나요?
- 1. 질문을 먼저 읽기Lab 제목에서 이번에 비교할 한 가지를 확인합니다.
- 2. 조건 하나만 바꾸기처음에는 n, 효과, 산포 같은 입력 중 하나만 바꾸십시오.
- 3. 분포 모양 또는 산포 조건 바꾸기 누르기새 합성 데이터가 만들어집니다. 같은 조건도 표본에 따라 달라질 수 있습니다.
- 4. 두 집단의 점 그림과 요약값 비교하기바꾸기 전후 무엇이 움직이고 무엇이 그대로인지 한 문장으로 적어보십시오.
막히면 초기화로 돌아가 기본 결과를 본 뒤 조건 하나만 바꾸십시오. 이 Lab은 정답 판정기가 아니라 패턴 관찰 도구입니다.
원자료점과 평균선
이번 비교의 요약
연구·임상·품질 판단에 사용하지 마십시오. 정식 Lab에서는 생성 모드, seed, simulator version, 단위, 한 행의 의미, raw/analysis-ready 표와 데이터 사전을 함께 제공합니다.
形を変えてもBの平均は10のままですが、点の幅、裾、集まり方が変わります。正式Labの自由探索では目標中心を10にしても、実標本平均は毎回正確に10にはなりません。生成目標と偶然得た一標本の要約は異なるため正常です。
JMPはこの理論をどう表すでしょうか
ここでのJMPはボタン順を学ぶためではなく、これまでの関係を出力につなぐために使います。連続データのJMP Distributionは三つの結果群を一緒に示します。
값들이 놓인 전체 모양과 중심·가운데 폭·이상값 후보를 함께 봅니다.
최솟값, Q1, 중앙값, Q3, 최댓값처럼 순서에 기반한 위치를 확인합니다.
평균, 표준편차와 N처럼 중심과 산포를 수치로 확인합니다.
AとBでは、まずNが独立実験単位数と一致するか確認します。Summary Statisticsで平均と標準偏差を一緒に読み、histogramと元データ点で幅・裾・群を調べ、QuantilesとOutlier Box Plotで中央値、IQR、外れ値候補を確認します。
両平均が10でも止まりません。Bの標準偏差が大きくヒストグラムが広ければ「同じ中心、異なる距離」です。ひげ外の点は削除せず履歴を調べます。二峰性ならbatchや隠れた条件を調べる仮説にはなりますが、原因の確定ではありません。
理論と本文の代表結果だけでも学べます。JMPやMinitabがあればLabからコピーした表で中心・散らばり・分布を確認してください。画面配置が違っても読む統計関係は同じです。
今日から平均の横に置く四つの問い
- この平均に入った独立nはいくつか。 技術反復行を独立標本として数えていないか確認します。
- 値は中心からどれほど広がるか。 標準偏差と元データ点の幅を一緒に見ます。
- 分布の形はどうか。 同じ軸・同じbinのヒストグラムで裾と群を調べます。
- 変わった点は何を要求するか。 自動削除ではなく試料と測定過程の再確認です。
平均は誤った数ではありません。ただし多くの情報を一数に圧縮します。良い分析は平均を捨てず、その横に散らばり、分布、元データ、反復構造を戻します。
次の単元では問いを広げます。手元の標本平均と標準偏差は母集団全体をどれほど表すでしょうか。同じ実験を繰り返すと値が変わる理由と、その揺れの表し方を学びます。
公式補足資料
- JMP Help · Distributions of Continuous Variables
- JMP Statistics Knowledge Portal · Box Plot
- NIST/SEMATECH e-Handbook · Measures of Scale
この記事の例とmini Labは統計概念を説明するための合成データです。実研究・臨床・品質・規制判断の根拠には使えません。