F04 단일 사슬을 넘어 — 단백질은 혼자 일하지 않습니다
F01~F04에서 다룬 AlphaFold2·3·ColabFold는 기본적으로 단일 사슬(monomer) 구조 예측을 중심에 뒀습니다. 그런데 세포 안에서 많은 생물학적 기능은 여러 단백질이 함께 결합한 복합체(complex) — 항체-항원 결합, 효소-기질 반응, 수용체-신호전달 단백질 결합 — 에서 일어납니다. 단일 사슬을 아무리 정확히 예측해도, 두 사슬이 실제로 어떻게 맞물리는지는 별개의 문제입니다.
이 편의 주제는 소분자 약물 후보(small-molecule ligand)와의 결합이 아니라 단백질끼리의 복합체입니다 — 소분자 리간드·핵산까지 아우르는 통합 예측은 F03에서 다룬 AlphaFold3의 영역이고, AlphaFold-Multimer는 그보다 앞서 단백질 사슬 여러 개의 조립에 특화된 확장판입니다.
AlphaFold-Multimer(Evans et al., 2021, bioRxiv preprint)는 AlphaFold2 아키텍처를 다중 사슬 입력에 맞게 확장한 버전입니다. 이 편에서는 단일 사슬 모델을 복합체용으로 바꿀 때 무엇이 달라지는지, 그리고 예측된 복합체 구조의 품질을 객관적으로 재는 지표들을 다룹니다.
다중 사슬로의 확장, 그리고 정렬 품질을 재는 수학
상대 위치 인코딩: "같은 사슬"과 "다른 사슬"을 구분하기
단일 사슬 모델은 잔기의 위치를 하나의 연속된 서열 인덱스로 인코딩하면 충분합니다. 그런데 두 개의 서로 다른 사슬을 이어 붙여 하나의 입력처럼 넣으면, 모델이 "사슬 A의 마지막 잔기와 사슬 B의 첫 잔기가 서열상 바로 옆이지만 실제로는 전혀 다른 폴리펩타이드"라는 사실을 헷갈릴 수 있습니다. AlphaFold-Multimer는 위치 인코딩에 **사슬 식별 정보(chain ID)**를 함께 인코딩해, "잔기 A가 잔기 B와 같은 사슬인지 아닌지"를 명시적으로 구분합니다. 또한 학습 시 여러 사슬을 함께 포함하는 크롭(cropping) 전략을 써서, 모델이 사슬 간 인터페이스(계면)를 학습 데이터에서 충분히 접하도록 합니다.
예측 품질을 재는 지표: TM-score
두 구조(예측 구조와 실험 구조)가 얼마나 비슷한지 재는 전통적 지표는 RMSD(평균제곱근편차)지만, RMSD는 단백질 일부가 유연하게 흔들리는 영역(loop 등)의 큰 오차 하나에 전체 값이 쉽게 휘둘리는 단점이 있습니다. TM-score(Zhang & Skolnick, 2004)는 이를 보완해, 잘 겹쳐진 잔기에는 후하게, 크게 어긋난 잔기에는 관대하게 점수를 매기는 방식으로 설계됐습니다.
는 (최적의 구조 중첩 및 잔기 정렬이 주어졌을 때) 정렬된 번째 잔기 쌍 사이의 거리, 은 기준 단백질 길이 에 따라 정해지는 정규화 거리입니다. 실제 TM-score 계산에는 이 값을 최대화하는 최적 강체 중첩(rigid-body superposition)을 찾는 과정이 포함되며, 아래 식은 그 최적 정렬이 이미 주어졌다고 가정했을 때의 점수입니다. 분모의 이 잔기별 오차를 제곱으로 반영하되, 전체 식이 0과 1 사이로 포화(saturate)되도록 설계되어 있어 한두 개의 큰 오차가 전체 점수를 무너뜨리지 않습니다(다만 정렬되지 않은 잔기도 분모 에는 포함되므로, 그런 잔기가 많으면 점수는 여전히 낮아집니다).
손 계산 예제: 잔기별 TM-score 기여도가 거리에 따라 어떻게 줄어드는가
기준 단백질 길이 일 때, 을 먼저 구합니다.
이 Å을 기준으로, 정렬 오차 가 각각 0.5Å(매우 정확), 3.65Å(과 같음), 10Å(크게 어긋남)인 세 잔기의 개별 기여도를 비교해봅시다.
거리가 과 같아지는 지점에서 정확히 기여도 0.5를 지나고, 그 이상 벌어져도 값이 완만하게 0으로 수렴할 뿐 음수가 되거나 폭주하지 않습니다. RMSD였다면 10Å짜리 오차 하나가 전체 평균을 크게 끌어올렸겠지만, TM-score는 이런 국소적 큰 오차의 영향을 자연스럽게 제한합니다.
복합체 전용 지표: ipTM
**pTM(predicted TM-score)**은 모델이 예측한 오차 정보(PAE, Predicted Aligned Error)로부터 "이 예측 구조 전체가 실제 구조와 TM-score 기준으로 얼마나 비슷할지"를 스스로 추정한 신뢰도 점수입니다. 그런데 pTM은 복합체 전체에 대해 하나의 값만 주기 때문에, "각 사슬 내부 구조는 맞지만 사슬 간 계면 배치는 완전히 틀린" 경우를 따로 잡아내지 못합니다. AlphaFold-Multimer는 ipTM(interface predicted TM-score) — 사슬 간 PAE를 이용해 "한 사슬을 고정했을 때 다른 사슬들의 상대 배치가 얼마나 정확할지"를 추정한 신뢰도 — 을 별도로 계산하고, 최종 순위 점수(ranking score)는 두 지표를 함께 반영합니다.
이 8:2 가중치는 모델 순위를 매기기 위한 경험적 설계이지, "인터페이스가 사슬 내부 폴딩보다 생물학적으로 4배 중요하다"는 정량적 근거를 뜻하는 것은 아닙니다. 다만 복합체 예측의 주된 관심사가 "사슬 내부 폴딩"보다 "두 사슬이 실제로 어떻게 맞물리는가"라는 점에서, 인터페이스 쪽에 더 큰 비중을 두는 방향 자체는 목적에 부합합니다.
R 실습: TM-score 잔기별 기여도 계산 재현
# 앞의 TM-score 손 계산 예제를 코드로 재현
L_ref <- 100
d0 <- 1.24 * (L_ref - 15)^(1/3) - 1.8
tm_contribution <- function(d, d0) 1 / (1 + (d / d0)^2)
distances <- c(0.5, d0, 10)
for (d in distances) {
cat(sprintf("d=%.3f -> 기여도=%.3f\n", d, tm_contribution(d, d0)))
}
# 복합체 순위 점수 계산 예시
ranking_score <- function(iptm, ptm) 0.8 * iptm + 0.2 * ptm
cat(sprintf("ipTM=0.85, pTM=0.90 -> Ranking Score=%.3f\n", ranking_score(0.85, 0.90)))CS 매핑
- 상대 위치 인코딩(Relative Positional Encoding): 사슬 식별 정보를 위치 인코딩에 추가하는 것은, Transformer가 토큰의 절대 위치뿐 아니라 문장·문서 경계 같은 구조적 구분을 함께 인코딩하는 기법과 같은 설계 원리입니다.
- 정렬 품질 지표 설계(Alignment Scoring): TM-score가 거리 오차를 시그모이드형 함수로 포화시켜 이상치에 강건하게 만드는 것은, 손실 함수 설계에서 이상치에 덜 민감한 Huber loss를 제곱오차(MSE) 대신 쓰는 것과 같은 사고방식입니다.
- 가중 다중목표 최적화(Weighted Multi-objective Scoring): ipTM과 pTM을 8:2로 가중합해 하나의 순위 점수를 만드는 것은, 여러 목표를 하나의 스칼라로 절충해 순위를 매기는 다중목표 최적화의 실용적 해법입니다.
자주 만나는 결함
- 낮은 ipTM을 pTM으로 착시: 전체 pTM은 높은데 ipTM만 낮은 예측은 "각 사슬 내부 구조는 맞지만 계면 배치는 신뢰할 수 없다"는 뜻입니다. 복합체 연구에서는 pTM이 아니라 ipTM을 먼저 확인해야 합니다.
- 화학양론(stoichiometry)을 잘못 지정: 실제로는 2:1 비율로 결합하는 복합체를 1:1로 입력하면, 모델이 애초에 틀린 조성으로 구조를 맞추려 하므로 결과 자체가 무의미해집니다.
- 낮은 ipTM을 "결합하지 않는다"는 증거로 해석: AlphaFold-Multimer는 결합 여부를 판정하는 분류기가 아니라 구조 예측 모델입니다. 낮은 ipTM은 우선 "모델이 상대 배치에 자신이 없다"는 뜻이며, 원인은 MSA 부족, 잘못된 화학양론 가정, 실제 구조 변화(conformational change), 무질서 영역, 경쟁하는 다른 결합 파트너 등 다양할 수 있습니다. 낮은 ipTM만으로 "이 복합체는 안정적으로 결합하지 않는다"고 단정해서는 안 되며, 결합 여부 판단에는 DockQ 같은 실측 기반 지표나 실험적 검증이 함께 필요합니다.
더 깊게 파고 싶다면
본문은 BPD 연구진이 직접 재구성한 서술입니다. 원 논문과 공식 자료로 심화해봅시다.
- AlphaFold-Multimer 원 논문: Evans et al. (2021), Protein complex prediction with AlphaFold-Multimer, bioRxiv 2021.10.04.463034 (preprint).
- TM-score 원 논문: Zhang & Skolnick (2004), Scoring function for automated assessment of protein structure template quality, Proteins.
- CASP15 어셈블리 카테고리 공식 결과:
predictioncenter.org/casp15— 정확한 타겟 수·평가지표·순위는 이 편에서 다루지 않았으므로, 인용 시 원문을 직접 확인해야 합니다.
F1.1(단백질 구조 예측) 5편을 마쳤습니다. AlphaFold 계열이 "이미 접힌 구조를 예측"하는 데 집중했다면, 다음 5편에서는 이보다 더 열려 있는 문제 — 접히지 않은 새로운 서열을 처음부터 설계하거나(de novo design), 도킹·분자동역학으로 결합·움직임 자체를 시뮬레이션하는 영역으로 넘어갑니다.