「PacBio SMRT」と「HiFi」を互換に使用しない
なぜこれが重要なのか?
ショートリードシーケンシングは多数の塩基を正確に読み取りますが、反復配列や大きな構造変異から遠く離れた位置にある変異のフェーズを連結する際には困難を伴います。PacBio SMRTシーケンシングは、単一のDNA分子の合成をリアルタイムで観察することでロングリードを生成し、現在のHiFiアプローチは長さの高いコンセンサス精度を同時に追求しています。
PacBio、long read、およびHiFiを相互に交換可能として扱うことは、世代を超えたデータ特性を曖昧にします。過去のCLR技術と現在のHiFiは、リードの生成方法、エラープロファイル、および適切な解析パイプラインにおいて異なります。
ZMW内のイベント
SMRTシーケンシングは、ゼロモード光導波路(ZMW)として知られる微小構造内に単一のDNAポリメラーゼを観察します。ヌクレオチド配列は、合成中に蛍光標識されたヌクレオチドからの信号を検出することで決定されます。DNA断片の両端にヘアピンアダプターを付けた環状テンプレートを構築することで、ポリメラーゼは同じ挿入配列を複数回通過することができます。
1回の通過はサブリードと呼ばれ、CCS(Circular Consensus Sequence)は複数の通過からの情報を組み合わせてコンセンサス配列として生成されます。十分なパス数と信号品質を備えたCCSは、HiFiリードの基盤となります。
CLRとHiFi
CLRは非常に長い連続リードの取得に焦点を当てていますが、単一リードのエラー率が比較的高く、十分なカバレッジまたは補正が必要です。HiFiは、コンセンサスを生成するために挿入断片を繰り返し読むことで、リードごとの精度を向上させます。ただし、同じ試料源に対して挿入長が過度に長い場合、パス数が減少し、コンセンサスの品質と他の要因の間にトレードオフが生じます。
したがって、実験的な選択は「最大リード長」のみに基づいて行われるものではありません。代わりに、研究課題が必要とする分子長、リードごとの精度、収量、およびカバレッジを考慮する必要があります。
何がより可視化されやすいか?
ロングリードは、リピート領域をまたがってユニークな側縁配列に接続することで、単一分子上で欠失、挿入、逆位、および複雑な構造変異(SV)の分断点を観察する可能性を高めます。1つのリード内で複数のヘテロ接合性変異をリンクすることも、ハプロタイプフェーシングを容易にします。ロングレンジの文脈情報は、de novoアセンブリやアイソフォームシーケンシングにおいても利点を提供します。
しかし、すべてのリピートがリード長より短いわけではなく、セグメンタル重複はマッピングを依然として複雑にする可能性があります。低頻度のモザイク変異および小型変異に対する性能は、深度、コールヤーの選択、およびアッセイの検証に依存します。
小さな例
2つのエクソン間に大きな挿入が疑われるが、ブレイクポイントが反復配列内に位置するため正確なアラインメントが困難であると仮定する。十分に長いHiFiリードが両側のユニークな配列および挿入全体をカバーする場合、イベント構造とアレル位相を明確に解像できる。一方、入力DNAが高度に断片化されている場合、ロングリードプラットフォームでも必要なスパンニング接続を取得できない可能性がある。
実験デザインとQC
高分子量DNAの抽出、シャーリング、サイズ選択はリード長を決定する。ライブラリ収量、ポリメラーゼのリード長、インサートサイズ分布、HiFi収量、リード品質、およびカバレッジは同時に評価すべきである。サンプルタイプと保存履歴はDNAの完全性に大きな影響を与える。
解析では、参照ビルド、アライナー/アセンブラ、SV/小変異コールラー、およびそれらのバージョンを文書化する必要がある。ケミストリーや装置ソフトウェアの変更も、歴史的データとの比較可能性に影響を与える。
一般的な誤解
- リード長が長いことが自動的に高精度を意味するわけではありません;HiFi生成条件を確認する必要があります。
- リードN50が高いことが、すべての座位で十分なカバレッジを保証するわけではありません。
- コンセンサス配列は、系統的バイアスとサンプル調製アーティファクトの両方を排除するものではありません。
- 長リードによって同定された事象は、臨床利用のために直交する確認と検証を必要とする場合があります。
解釈の境界
有用性は、入力分子の品質、挿入サイズ、カバレッジ、化学的性質、およびソフトウェアに依存します。プラットフォーム名のみを根拠として既存のアッセイに対する優位性を想定しないでください。代わりに、各質問に対して性能を検証してください。
文脈における読み取り
相同領域の問題は、擬遺伝子マッピングの物語につながり、アッセイ選択がWGS、WES、およびパネルとして行われ、参照配列とアセンブリがヒトゲノムプロジェクトからパンゲノムへへと進化していく。