Pseudogene — 유전체 화석과 mapping 함정 사이
왜 알아야 하는가
pseudogene은 흔히 “기능을 잃은 유전자 복사본”으로 소개되지만 하나의 기원이나 성질을 가진 집단이 아닙니다. 어떤 것은 mRNA가 유전체로 다시 삽입되어 생기고, 어떤 것은 gene duplication 뒤 한 사본에 기능 상실 변화가 축적되어 생깁니다. 다른 종에서는 기능 유전자인데 특정 계통에서만 기능을 잃은 경우도 있습니다.
이들을 이해해야 하는 이유는 두 가지입니다. 일부 locus는 전사나 조절과 연결될 가능성이 있고, 동시에 기능 유전자와의 높은 서열 유사성이 sequencing 분석을 방해합니다. 생물학적 질문과 기술적 함정을 분리해 살펴야 합니다.
핵심 개념
processed pseudogene은 보통 intron이 제거된 RNA에서 유래하고 원래 promoter를 갖지 않는 경우가 많습니다. duplicated 또는 unprocessed pseudogene은 유전자 복제에서 유래해 exon–intron 구조와 주변 조절서열 일부를 유지할 수 있습니다. unitary pseudogene은 해당 계통에서 유일한 기능 사본이 기능을 잃은 경우를 가리킵니다. annotation database는 서열 계보와 구조를 바탕으로 이 biotype을 구분합니다.
pseudo라는 이름이 항상 전사되지 않거나 아무 역할도 없다는 뜻은 아닙니다. 일부 pseudogene transcript가 miRNA 경쟁, antisense regulation 또는 parent gene 발현과 관련됐다는 연구가 있습니다. 그러나 RNA가 검출됐다는 사실만으로 생리 기능이나 질병 기여가 증명되지는 않습니다. locus-specific perturbation과 rescue, 적절한 조직·조건의 재현이 필요합니다.
Mapping 문제가 생기는 이유
short read가 parent gene과 pseudogene에 모두 거의 동일하게 맞으면 aligner는 위치를 하나로 정하기 어렵습니다. 임의 위치에 배치하거나 multi-mapping read를 버리면 false positive와 false negative가 모두 생길 수 있습니다. variant caller가 parent gene의 차이를 pseudogene variant로, 또는 반대로 해석할 위험도 있습니다.
이 문제는 단순히 depth를 늘려 해결되지 않습니다. 동일하게 모호한 read가 더 많이 생길 수 있기 때문입니다. unique flanking sequence를 포함하는 locus-specific primer, tailored alignment, long-range PCR, 독립 assay 또는 충분히 긴 read가 필요할 수 있습니다.
작은 분석 예시
기능 유전자 G와 매우 유사한 pseudogene P가 있다고 합시다. P에 흔한 염기가 G의 pathogenic variant 위치와 같다면, P에서 유래한 read가 G에 잘못 정렬되어 가짜 변이를 만들 수 있습니다. 반대로 G의 실제 변이 read가 낮은 mapping quality로 제거되면 놓칠 수도 있습니다.
분석자는 해당 영역의 mappability, read pair 배치, allele balance와 population artifact를 보고 orthogonal confirmation을 설계합니다. “coverage가 충분하다”는 보고만으로는 이 위험을 평가할 수 없습니다.
기능 연구에서 필요한 대조
pseudogene RNA를 측정할 때는 parent gene과 구분되는 primer와 unique sequence를 확인해야 합니다. knockdown reagent가 두 locus를 동시에 표적하지 않는지도 중요합니다. 과발현 실험은 생리적 발현량을 벗어날 수 있으므로 endogenous perturbation과 독립적인 rescue가 더 강한 증거가 됩니다.
질환 연관 연구에서는 locus의 transcription과 기능, 환자 phenotype, 인과 변이를 서로 다른 주장으로 기록해야 합니다.
혼동하기 쉬운 점
- pseudogene은 모두 같은 방식으로 생긴 유전체 화석이 아닙니다.
- 전사됨은 기능함과 같지 않고, 기능 가능성은 질환 인과성과 같지 않습니다.
- high coverage는 high mappability를 뜻하지 않습니다.
- long read도 library, read accuracy와 분석 pipeline이 검증돼야 하며 자동 정답은 아닙니다.
한계
annotation은 reference assembly와 database release에 따라 달라지고, pseudogene 경계나 biotype이 갱신될 수 있습니다. 임상검사는 어려운 locus의 검출 범위와 확인법을 명시해야 하며 음성 결과의 잔여 위험을 숨기지 않아야 합니다.
연결해서 읽기
검사별 blind spot 선택은 WGS·WES·panel, long-read의 장점과 조건은 PacBio SMRT와 HiFi, reference 좌표 의존성은 Reference genome Concept과 연결됩니다.