목록으로

PacBio SMRT — 긴 read와 HiFi를 같은 말로 쓰지 않기

이 글은 개념과 근거의 범위를 설명하며, 개별 환자의 진단·검사·치료 결정을 제공하지 않습니다.

심화
|
6분
|
검증 완료 (2026-08-21)
PacBioSMRTHiFilong-read sequencing
진행률0/29 (0%)

PacBio SMRT — 긴 read와 HiFi를 같은 말로 쓰지 않기

왜 알아야 하는가

Short read는 많은 염기를 정확히 읽지만 반복서열, 큰 구조변이와 멀리 떨어진 variant의 phase를 연결하기 어렵습니다. PacBio SMRT sequencing은 단일 DNA molecule의 합성을 실시간 관찰해 긴 read를 만들고, 현재의 HiFi 방식은 길이와 높은 consensus accuracy를 함께 추구합니다.

PacBio, long read, HiFi를 같은 말로 쓰면 세대별 데이터 특성을 놓칩니다. 과거 CLR과 현행 HiFi는 read 생성과 오류 프로필, 적합한 분석 pipeline이 다릅니다.

ZMW에서 일어나는 일

SMRT는 zero-mode waveguide(ZMW)라는 미세 구조 안의 단일 DNA polymerase를 관찰합니다. fluorescent nucleotide가 합성될 때의 신호로 염기서열을 읽습니다. DNA fragment 양끝에 hairpin adapter를 붙인 circular template를 만들면 polymerase가 같은 insert를 여러 번 통과할 수 있습니다.

한 번의 통과는 subread이며 여러 통과 정보를 consensus로 합친 것이 CCS입니다. 충분한 pass와 신호 품질을 가진 CCS가 HiFi read의 기반이 됩니다.

CLR과 HiFi

CLR은 매우 긴 연속 read를 얻는 데 초점을 두었고 단일 read 오류가 상대적으로 높아 충분한 coverage나 보정이 필요했습니다. HiFi는 insert를 반복해 읽고 consensus를 만들어 read 단위 정확도를 높입니다. 같은 원자료에서도 insert 길이가 지나치게 길면 pass 수가 줄어 consensus 품질과 trade-off가 생길 수 있습니다.

따라서 최대 read length만으로 실험을 선택하지 않습니다. 연구 질문에 필요한 molecule length, per-read accuracy, yield와 coverage를 함께 봅니다.

무엇이 더 잘 보이는가

긴 read는 repeat를 가로질러 unique flanking sequence에 연결하고, deletion·insertion·inversion과 complex SV breakpoint를 한 molecule에서 관찰할 가능성을 높입니다. 한 read 안의 여러 heterozygous variant를 연결해 haplotype phasing에도 유용합니다. de novo assembly와 isoform sequencing에서도 긴 문맥이 장점입니다.

하지만 모든 repeat가 read보다 짧은 것은 아니며 segmental duplication은 여전히 mapping을 어렵게 할 수 있습니다. low-frequency mosaic variant와 작은 variant 성능도 depth, caller와 assay validation에 의존합니다.

작은 예시

short read에서 두 exon 사이 큰 insertion이 의심되지만 breakpoint가 반복서열 안에 있어 정확히 정렬되지 않는다고 합시다. 충분히 긴 HiFi read가 양쪽 unique sequence와 insertion 전체를 연결하면 event 구조와 allele phase를 명확히 할 수 있습니다. 반대로 input DNA가 잘게 끊어져 있으면 long-read platform을 써도 필요한 연결을 얻지 못합니다.

실험 설계와 QC

고분자량 DNA 추출, shearing과 size selection이 read length를 결정합니다. library yield, polymerase read length, insert-size distribution, HiFi yield, read quality와 coverage를 함께 확인합니다. sample type과 storage history가 DNA integrity에 큰 영향을 줍니다.

분석에는 reference build, aligner·assembler, SV·small-variant caller와 version을 기록합니다. chemistry와 instrument software 변화도 과거 자료와의 비교에 영향을 줍니다.

혼동하기 쉬운 점

  • long read는 자동으로 높은 accuracy를 뜻하지 않으며 HiFi 생성 조건을 확인해야 합니다.
  • 높은 read N50가 모든 locus의 충분한 coverage를 보증하지 않습니다.
  • consensus는 systematic bias와 sample preparation 문제를 모두 제거하지 않습니다.
  • long read가 발견한 event도 임상 사용에는 orthogonal confirmation과 validation이 필요할 수 있습니다.

해석 경계

유용성은 input molecule quality, insert size, coverage, chemistry와 software에 좌우됩니다. platform 이름만 보고 기존 검사보다 우월하다고 단정하지 않고 질문별 성능을 검증합니다.

연결해서 읽기

상동영역 문제는 Pseudogene mapping, 검사 선택은 WGS·WES·panel, reference와 assembly는 Human Genome Project 이후 pangenome Story로 이어집니다.

References

💬 질문과 댓글

0개의 댓글

로그인 없이 작성할 수 있습니다. 비로그인 댓글은 작성 후 직접 수정·삭제할 수 없습니다.

0/2000

로딩 중...