CosyVoice 2
Alibaba FunAudioLLM 팀이 2024년 12월에 출시한 **CosyVoice 2**는 최첨단 딥러닝 기반 스트리밍 음성 합성(TTS) 및 음색 복제(Voice Cloning) 오픈소스 엔진입니다. 이 도구는 대규모 언어 모델(LLM)과 청크 단위 인과적 흐름 매칭(Chunk-aware causal flow matching) 아키텍처를 융합하여, 단 3초 수준의 짧은 참고 오디오만으로 화자의 독특한 음색, 감정선, 호흡을 완벽하게 재현합니다. 사용자는 이 시스템을 통해 텍스트 입력을 바탕으로 사람에 버금가는 고해상도 오디
Alibaba FunAudioLLM 팀이 2024년 12월에 출시한 CosyVoice 2는 최첨단 딥러닝 기반 스트리밍 음성 합성(TTS) 및 음색 복제(Voice Cloning) 오픈소스 엔진입니다. 이 도구는 대규모 언어 모델(LLM)과 청크 단위 인과적 흐름 매칭(Chunk-aware causal flow matching) 아키텍처를 융합하여, 단 3초 수준의 짧은 참고 오디오만으로 화자의 독특한 음색, 감정선, 호흡을 완벽하게 재현합니다. 사용자는 이 시스템을 통해 텍스트 입력을 바탕으로 사람에 버금가는 고해상도 오디오 출력을 실시간으로 생성할 수 있으며, 다국어 합성 및 다국어 혼용(Code-switching)을 자연스럽게 지원받습니다. 기존의 음성 합성 시스템은 긴 녹음 파일과 복잡한 미세조정(Fine-tuning) 과정을 거쳐야만 자연스러운 음색 복제가 가능했고, 실시간 대화에 적합한 초저지연 스트리밍 환경을 구축하기 위해 별도의 최적화 모델을 이중으로 구현해야 하는 한계가 있었습니다. 반면에 CosyVoice 2는 유한 스칼라 양자화(Finite-Scalar Quantization) 기술을 사용하여 음성 신호를 조밀한 이산 토큰으로 인코딩함으로써 음소의 의미 정보와 화자의 음색 정보를 효율적으로 분리해 냅니다. GPT가 텍스트 토큰을 예측하여 다음 문장을 완성해 나가듯, 이 모델은 텍스트 조건 하에 다이내믹한 흐름 매칭을 구현하여 비유하자면 '음성용 GPT'처럼 동작하여 고품질 배치 생성과 150ms 이하의 초저지연 스트리밍 출력을 단일 파이프라인에서 완벽하게 처리합니다. 생명공학 및 임상 의학 연구 현장에서 CosyVoice 2는 학술 논문 요약 콘텐츠나 환자 교육용 의료 상담 데이터를 자동 오디오북 및 다국어 더빙 파일로 변환하는 데 유용하게 쓰일 수 있습니다. 연구 발표 자료를 비영어권 세미나에 배포할 때, 발표자의 기존 3초 분량 녹음본만 제공하면 발표자 본인의 실제 음색 그대로 영어, 중국어, 일본어 등 9개 언어의 오디오북을 자연스럽게 변환 생성할 수 있습니다. 또한, 복잡한 유전자 구조나 면역 반응 데이터를 낭독할 때 문장의 억양, 속도, 감정을 정밀 제어하여 청각 자료의 몰입감을 극대화하고 시각 장애 연구원을 위한 연구 편의성을 제고할 수 있습니다.
💻 필요한 컴퓨터 사양
NVIDIA GPU VRAM 8GB 이상 권장 (RTX 3060/4060급 이상 실시간 스트리밍), CPU 단독 실행 시 지연 대폭 증가
모델 및 종속 패키지 포함 최소 5GB 여유 공간 (CosyVoice2-0.5B 모델 파일 약 1GB)
⚡ 설치법
### 4-1. Quick Start
git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git
cd CosyVoice
conda create -n cosyvoice -y python=3.10 && conda activate cosyvoice
pip install -r requirements.txt
### 4-2. 상세 설치
# 1. 시스템 사운드 종속성 설치 (Ubuntu 기준)
sudo apt-get install sox libsox-dev -y
# 2. 콘다 환경 생성 및 활성화
conda create -n cosyvoice -y python=3.10
conda activate cosyvoice
# 3. pynini 및 WeTextProcessing 종속성 conda 설치
conda install -y -c conda-forge pynini==2.1.5
# 4. 파이썬 요구 라이브러리 설치
pip install -r requirements.txt
# 5. Hugging Face에서 CosyVoice2 0.5B 프리트레인 모델 다운로드
python3 -c "
from huggingface_hub import snapshot_download
snapshot_download('FunAudioLLM/CosyVoice2-0.5B', local_dir='pretrained_models/CosyVoice2-0.5B')
"📝 업데이트 노트
아직 업데이트 노트가 없습니다.
🧪 관련 생명의 코드
관련된 생명의 코드 글이 아직 없습니다.