反復測定、クラスター化、擬似反復
このトピックを完了すると
反復測定データおよびクラスター化データにおける観測値間の関連性を特定できるようになります。擬似反復(サブレベルの行を独立した単位として数えることでサンプルサイズを過大評価する現象)を特定し、要約、階層モデル、または設計改善のいずれを選択する前に必要な問いを明確にします。
行数が多いからといって、必ずしも独立した情報が多いわけではありません
一つの独立した単位から、複数の時間点、複数のウェル、または複数の画像が生成されることがあります。データフレームに多くの行が含まれていても、それらが同じ上位レベルの単位から値を共有しているため、互いに独立していない可能性があります。反復測定の核心は行数そのものではなく、関連構造にあります。
階層スキーマ
study_id → subject_id → timepoint → measurement_id各レベルが実際の研究単位に対応していることを確認します。処置が subject_id に割り当てられているにもかかわらず、measurement_id が独立した反復として数えられている場合、擬似反復のリスクが生じます。同じ被験者の時間点は、時間的な順序と共通の状態を共有します。
クラスター化も同様です。バッチ、プレート、サイトなど、共通の環境や処理ステップを共有する単位がある場合、同じクラスター内の観測値は互いに類似している可能性があります。クラスターIDを単純なカテゴリカル列として記録することは、分析においてその相関構造を反映することとは異なります。
対応の3つの方向性
反復の目的が測定誤差の低減である場合、独立した単位レベルで要約することができます。時間的またはクラスター固有の変化をモデル化する場合、階層構造を反映する方法を検討できます。設計が不明確な場合は、まず研究記録およびデータ系譜を補完します。
どの方向性も、すべての反復データに自動的に適用されるルールではありません。結果変数のタイプ、時間点数、欠測、割り当てレベル、および問いに基づいて選択し、その根拠を文書化します。
ロング形式での構造確認
反復測定データはロング形式で表現でき、一行に subject_id、time、measurement_id、outcome を記録します。同じ subject_id が複数の行にわたって出現することは、複製エラーではなく反復構造を示している可能性があります。まず各 subject_id 当たりの時間点数と欠測箇所を数えることで、どの上位レベルの単位が不完全であるかを確認できます。
逆に、上位レベルの単位IDがない場合、measurement_id のみが存在すると、独立性の構造を回復することは困難です。分析前に、生データ、ラボノートブック、またはプレートマップから上位レベルのIDを補完します。確認できない場合は、独立性を恣意的に仮定しないでください。
各グループごとの一意な subject_id の数を総行数と並べて報告することで、観測数と独立した単位数の違いが明らかになります。結果表の各表および図において、n がどのレベルで数えられているかを指定します。
解釈のための研究問いへの回帰
反復測定データに対する問いは、「すべての行の平均が異なるか」ではなく、「独立した単位内の変化と独立した単位間の差異をどのように区別するか」です。これらを区別しないことは、不確実性の過小評価につながります。
一般的な失敗例
- 被験者の複数の時間点を独立したサンプルとして数えない。
- 同じプレート上のウェルを自動的に独立として扱わない。
- 反復値を恣意的に平均化し、時間情報を失わない。
- 構造を確認せずに自動的に混合モデルを指定しない。
重要なポイント
- 反復測定およびクラスター化データの核心は、上位レベルの単位と関連構造です。
- 行数が独立した情報の量と等しいとは限りません。
- 要約、階層モデル、設計改善は、問いと構造によって決定されます。
次のトピック
次のセクションでは、OLS、共変量、および診断に進みます。
参考文献
- Bioconductor OSTA実験デザイン: https://bioconductor.org/books/release/OSTA/pages/bkg-exp-design.html
このセクションの階層スキーマおよび説明は、BioStatPyによって独立して作成されました。