목록으로

prediction target·baseline·metric

바이오 예측 문제에서 target과 prediction horizon을 명확히 하고 단순 baseline 및 AUROC·AUPRC 등 metric을 선택하는 기준을 정리합니다.

심화
|
25
|
검증 완료 (2026-08-07)
BioStatPy머신러닝 평가지표AUROC AUPRCbaseline model예측 타깃
진행률0/33 (0%)

prediction target·baseline·metric

이 토픽을 마치면

예측 target과 분석 단위를 정의하고, baseline과 metric을 같은 역할로 혼동하지 않을 수 있습니다. accuracy 하나로 모델을 평가하지 않고 연구 목적과 오류 비용에 맞는 metric을 선택합니다.

예측 질문을 데이터 계약으로 바꾸기

“이 샘플의 결과를 예측할 수 있는가?”라는 질문에는 target, prediction time, 사용 가능한 feature, 평가 단위가 필요합니다. target이 미래 시점의 결과인지 현재 이미 관측된 값인지 확인하지 않으면 leakage가 생길 수 있습니다.

baseline은 출발점이다

baseline은 평균·다수 클래스·기존 규칙처럼 복잡한 모델과 비교할 최소 기준입니다. baseline보다 좋아 보인다는 것은 해당 평가 설계 안에서의 개선이지, 모든 환경에서 유용하다는 뜻은 아닙니다.

metric은 질문의 비용을 반영한다

회귀에서는 MAE와 RMSE가 서로 다른 오류 민감도를 가질 수 있고, 분류에서는 precision·recall·ROC AUC·average precision이 서로 다른 관점을 제공합니다. class imbalance에서는 accuracy가 다수 클래스만 반영할 수 있습니다. metric의 정의와 선택 이유를 사전에 적습니다.

metric 선택표 만들기

예측 오류가 원래 outcome 단위로 얼마나 큰지 알고 싶다면 MAE처럼 단위가 유지되는 metric을 검토할 수 있습니다. 큰 오류에 더 높은 가중을 두려면 RMSE의 성질을 확인합니다. 분류에서는 놓친 양성의 비용과 잘못된 양성의 비용이 다를 수 있으므로 recall과 precision의 우선순위를 연구 목적에 연결합니다.

여러 metric을 함께 보고할 수 있지만 primary metric은 모델 결과를 보기 전에 정합니다. 보조 metric은 모델의 다른 실패 양상을 보여주는 데 사용하고, 가장 좋은 숫자만 골라 대표 성능으로 만들지 않습니다.

baseline과 모델 개선

다수 클래스 baseline, 평균 예측 baseline, 기존 규칙 기반 baseline은 서로 다른 질문을 제공합니다. 모델이 baseline을 넘어섰다면 절대 차이와 불확실성을 함께 보고합니다. 작은 성능 향상이 실제 운영 비용과 외부 검증에서도 유지되는지는 별도의 판단입니다.

연구 질문으로 돌아가 해석하기

예측 성능은 인과 효과가 아닙니다. 좋은 metric 결과가 생물학적 기전이나 외부 사이트의 성능을 보장하지 않습니다. target의 정의, 평가 단위, 데이터 분할과 함께 보고합니다.

자주 생기는 실패

  • target을 feature에 포함하지 않습니다.
  • baseline과 실제 운영 기준을 구분하지 않습니다.
  • accuracy 하나로 불균형 분류를 평가하지 않습니다.
  • metric을 본 뒤 유리한 것을 선택하지 않습니다.

핵심 정리

  • prediction target과 평가 단위를 먼저 정의합니다.
  • baseline은 비교 출발점입니다.
  • metric은 오류 비용과 연구 목적에 맞게 선택합니다.

다음 토픽으로

다음 편에서는 leakage를 막기 위한 Pipeline과 group/time/site split을 다룹니다.

참고 자료

본 편의 target schema와 예시는 BioStatPy가 독립적으로 작성했습니다.

💬 질문과 댓글

0개의 댓글

로그인 없이 작성할 수 있습니다. 비로그인 댓글은 작성 후 직접 수정·삭제할 수 없습니다.

0/2000

로딩 중...