混合モデルの基礎
本トピックの完了後
固定効果とランダム効果を研究デザインのレベルに結びつけることができるようになる。グループ化変数を無作為にランダム効果として割り当てることを避け、反復、クラスター構造、収束警告をモデル診断の一部として解釈できるようになる。
モデルに階層構造を含める理由
同じ被験者、プレート、またはサイトからの観測値は共通のばらつきを共有する可能性がある。すべての反復を独立した標本として扱うと不確実性を過小評価する恐れがあり、単純な平均値で要約すると時間やクラスター情報が失われる可能性がある。混合モデルは、関心のある固定効果とグループレベルのばらつきを分離する一つのアプローチである。
固定効果とランダム効果
固定効果は、研究者が解釈のために事前に定義した条件や共変量の効果である。ランダム効果は、観測されたグループをより大きなグループの集合から来ているとみなし、グループごとに異なる切片や傾きを許容する構造である。この区別は変数のデータ型だけで決まるものではなく、研究デザインと推論の対象に依存する。
MixedLMの最小限の構造
import statsmodels.formula.api as smf
model = smf.mixedlm( "outcome ~ exposure + time", data=data, groups=data["subject_id"],)result = model.fit()print(result.fe_params)subject_idは反復観測のグループキーであり、exposureとtimeの意味はデータ契約で定義されるべきである。適合結果が返された場合でも、収束警告、ランダム効果の構造、残差、欠測を確認すること。
モデル選択よりも構造検証
すべての反復データに混合モデルを適用してはならない。グループが十分に存在するか、グループがどの母集団を表すか、研究質問に対してランダム傾きが必要かどうか、測定時間点と欠測の関係を検証せよ。収束の失敗は、単に警告を隠蔽する問題ではなく、モデル、データ、またはスケールに問題があることを示すシグナルである。
ランダム切片はグループごとに異なる切片を許容し、ランダム傾きは共変量や時間との関係がグループによって変化するのを許容する。より複雑なランダム効果の構造が常に良いわけではない。データにそのばらつきを区別する情報を含んでいるか、モデルが安定して適合しているかを確認しなければならない。
収束警告が発生した場合、最適化子を繰り返し呼び出して警告が消えた結果のみを選択してはならない。入力のスケール、グループごとの観測数、分散推定値が境界上にあるかどうか、モデル構造が過度に複雑でないかを確認せよ。すべての試行と警告を記録すること。
解釈のために研究質問に戻る
固定効果は指定されたグループ構造を条件とした平均的な関係を表し、ランダム効果はグループ間のばらつきを表す。これらを自動的に因果効果や生物学的メカニズムとして解釈してはならない。グループレベル、時間、欠測、外挿を一緒に報告すること。
一般的な失敗例
- 数値的な大きさを持つ共変量として被験者IDを使用しない。
- すべてのカテゴリカル変数をランダム効果として含めない。
- 収束警告を隠蔽して係数を確定しない。
- 反復測定構造を検証せずに混合モデルを万能薬として使用しない。
重要なポイント
- 混合モデルは階層構造と反復構造を表す一つの方法である。
- 固定効果とランダム効果の区別は、研究デザインと推論の対象に依存する。
- 収束と診断は結果の一部である。
次のトピック
次のセクションでは、時間構造と連動して経時変化と脱落/欠測について扱う。
参考文献
- statsmodels API: https://www.statsmodels.org/stable/api.html
- Bioconductor OSTA実験デザイン: https://bioconductor.org/books/release/OSTA/pages/bkg-exp-design.html
本セクションの階層スキーマとコードはBioStatPyによって独立して記述されました。