F5-TTS
상하이교통대학교와 홍콩과학기술대학교 연구진이 2024년 10월 발표한 **F5-TTS**는 흐름 정합(Flow Matching) 기술과 확산 트랜스포머(Diffusion Transformer, DiT) 아키텍처를 결합한 차세대 비자동회귀(Non-autoregressive) 텍스트-음성 합성(Text-to-Speech) 모델입니다. 이 모델은 단 3초에서 5초 수준의 짧은 참조 음성 샘플만으로도 대상의 음색, 억양, 감정선 및 주변 음향 환경을 정밀하게 복제하는 제로샷 음성 복제(Zero-Shot Voice Cloning) 기능을 제
상하이교통대학교와 홍콩과학기술대학교 연구진이 2024년 10월 발표한 F5-TTS는 흐름 정합(Flow Matching) 기술과 확산 트랜스포머(Diffusion Transformer, DiT) 아키텍처를 결합한 차세대 비자동회귀(Non-autoregressive) 텍스트-음성 합성(Text-to-Speech) 모델입니다. 이 모델은 단 3초에서 5초 수준의 짧은 참조 음성 샘플만으로도 대상의 음색, 억양, 감정선 및 주변 음향 환경을 정밀하게 복제하는 제로샷 음성 복제(Zero-Shot Voice Cloning) 기능을 제공합니다. 기존 자동회귀 방식 모델들이 단어 및 토큰 단위로 순차적 생성을 진행하여 처리 속도에 한계가 있었던 반면, F5-TTS는 텍스트 입력과 음성 파형 생성 과정 전체를 단순화된 단일 아키텍처로 처리하여 생성 효율성과 자연스러움을 동시에 대폭 개선했습니다. 기존의 음성 합성 시스템들은 텍스트 정렬을 위한 복잡한 음소 변환기(Phoneme Aligner), 복잡한 지속 시간 예측기(Duration Model), 별도의 텍스트 인코더 모듈을 다단계 파이프라인으로 연결해야 했기 때문에 시스템 구축 및 연산 복잡도가 높았고 발음 오류나 중간 단계 정보 손실이 빈번하게 발생했습니다. 마치 화가가 캔버스 위 가이드라인을 따라 물감을 자연스럽게 흘려보내듯, F5-TTS는 텍스트 길이에 맞춰 패딩 토큰(Filler Tokens)을 채운 뒤 연속 시간 정규화 흐름(Continuous Normalizing Flow) 기술을 적용하여 노이즈 상태에서 목표 음성 특징으로 매끄럽게 전환시킵니다. 여기에 ConvNeXt 텍스트 정제 블록 및 추론 시 연산량을 최적화하는 스웨이 샘플링(Sway Sampling) 기법을 도입함으로써, 음소 사전이나 복잡한 전처리 파이프라인 없이도 자연스러운 다국어 교차 합성(Multilingual Code-Switching)과 정밀한 발화 속도 제어를 구현했습니다. 생명공학 연구 및 임상 의학 현장이나 다국어 학술 발표 환경에서 F5-TTS는 원저자의 음색을 유지한 채 학술 강연을 다국어로 변환하거나 음성 장애 환자의 보조 공학 도구 개발에 유용하게 적용될 수 있습니다. 연구자가 수집한 5초 분량의 참조 음성 데이터(.wav)와 변환 대상 학술 텍스트를 입력하면, 0.15 수준의 실시간 생성 비율(Real-Time Factor, RTF)로 빠르게 음성을 합성해 내며 보급형 GPU 환경에서도 실시간에 가까운 인퍼런스가 가능합니다. 예를 들어 1024 토큰 상당의 서술문을 처리할 때 30단계의 정교한 스웨이 샘플링 파라미터를 설정하여 배경 소음이 제거된 깨끗한 환경에서 억양 왜곡 없이 고품질 오디오 파일을 즉각 생성할 수 있습니다. 또한 F5-TTS는 수백 시간 분량의 대규모 학습 데이터를 기반으로 구축되어 한국어, 영어, 중국어 등 다양한 언어 간의 혼용 발화나 급격한 감정 변화 상황에서도 안정적인 주파수 스펙트로그램을 생성해 냅니다. 이러한 경량화 단일 아키텍처 중심의 설계는 오프라인 서버 환경이나 에지 컴퓨팅 연구 환경에 손쉽게 이식될 수 있어, 민감한 개인 음성 데이터나 보건 의료 텍스트를 외부 클라우드 API 전송 없이 로컬 단독 환경에서 안전하게 처리할 수 있는 강력한 인프라적 이점을 제공합니다.
💻 필요한 컴퓨터 사양
최소 6GB (NVIDIA GPU), 권장 12GB+ (RTX 3060 이상 추천). CPU 환경 시 생성 속도 저하 (RTF 1.5~3.0)
모델 체크포인트 ~1.5GB (Base 모델 기준), 패키지 및 전처리 디렉터리 5GB 이내
⚡ 설치법
### 4-1. Quick Start
```bash
# PyTorch 환경 설정 후 pip 패키지 설치
pip install f5-tts
# CLI 환경에서 zero-shot 음성 합성 실행
f5-tts_infer-cli --model F5TTS_Base --ref_audio reference.wav --ref_text "참조 음성 텍스트" --gen_text "합성할 대상 텍스트"
```
### 4-2. 상세 설치
```bash
# GitHub 소스 코드 클론 및 가상환경 구축
git clone https://github.com/SWivid/F5-TTS.git
cd F5-TTS
python3 -m venv f5-env
source f5-env/bin/activate
# 개발 모드 패키지 설치
pip install -e .
# Gradio Web UI 인터페이스 실행
f5-tts_infer-gradio
```🧬 바이오 활용
다국어 연구 및 학술 발표 음성 합성**
5초 분량의 발표자 원본 음성 샘플(`ref.wav`, 24kHz)과 다국어 학술 텍스트를 입력하여, Sway Sampling nfe=30 설정 기반 RTF 0.15 속도로 원작자의 억양을 유지한 영·한 교차 발화 오디오 자동 생성
청각/언어 장애 연구 및 디지털 튜터링 시나리오**
소음이 제거된 3초 분량의 환자 과거 음성 텍스트 pair 데이터를 지침으로 삼아 F5TTS_Base 모델 인퍼런스를 수행, 면적 및 피치 변동성 지표 왜곡 없이 명료한 대화형 음성 가이드 보조 파이프라인 구축
로컬 에지 환경 온프레미스 통합**
외부 Cloud API 연결 없이 12GB VRAM GPU 장비 상에서 Gradio UI 기반 오프라인 단독 구동을 통해 개인정보 보호 텍스트 데이터를 100% 온프레미스로 안전하게 음성 파형 합성
📝 업데이트 노트
아직 업데이트 노트가 없습니다.
🧪 관련 생명의 코드
관련된 생명의 코드 글이 아직 없습니다.