CosyVoice 2
Motor open source de TTS en streaming y clonación de voz basado en deep learning
CosyVoice 2, lanzado por el equipo FunAudioLLM de Alibaba en diciembre de 2024, combina un LLM con flow matching causal consciente de chunks. Con solo tres segundos de audio de referencia reproduce timbre, emoción y respiración, genera audio de alta resolución en tiempo real y admite síntesis multilingüe y code-switching.
La cuantización finite-scalar codifica la señal en tokens discretos densos y separa información fonética y de timbre. El modelo funciona como un «GPT para voz», ofreciendo generación por lotes y streaming de latencia inferior a 150 ms en una sola canalización.
En investigación convierte resúmenes y asesoramiento médico en audiolibros y doblajes en nueve idiomas conservando la voz del presentador. También permite controlar entonación, velocidad y emoción al narrar estructuras génicas o respuestas inmunes, mejorando accesibilidad.
💻 Requisitos del sistema
Se recomienda GPU NVIDIA de 8 GB o más para streaming en tiempo real; CPU aumenta mucho la latencia.
Al menos 5 GB; el modelo CosyVoice2-0.5B ocupa ~1 GB.
⚡ Instalación
4-1. Inicio rápido
git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git
cd CosyVoice
conda create -n cosyvoice -y python=3.10 && conda activate cosyvoice
pip install -r requirements.txt
4-2. Instalación detallada
sudo apt-get install sox libsox-dev -y
conda create -n cosyvoice -y python=3.10
conda activate cosyvoice
conda install -y -c conda-forge pynini==2.1.5
pip install -r requirements.txt
python3 -c "from huggingface_hub import snapshot_download; snapshot_download('FunAudioLLM/CosyVoice2-0.5B', local_dir='pretrained_models/CosyVoice2-0.5B')"
🧬 Casos de uso en biociencias
Aplicación práctica
CosyVoice 2, lanzado por el equipo FunAudioLLM de Alibaba en diciembre de 2024, combina un LLM con flow matching causal consciente de chunks. Con solo tres segundos de audio de referencia reproduce timbre, emoción y respiración, genera audio de alta resolución en tiempo real y admite síntesis multilingüe y code-switching.
La cuantización finite-scalar codifica la señal en tokens discretos densos y separa información fonética y de timbre. El modelo funciona como un «GPT para voz», ofreciendo generación por lotes y streaming de latencia inferior a 150 ms en una sola canalización.
En investigación convierte resúmenes y asesoramiento médico en audiolibros y doblajes en nueve idiomas conservando la voz del presentador. También permite controlar entonación, velocidad y emoción al narrar estructuras génicas o respuestas inmunes, mejorando accesibilidad.
FAQ
¿Qué es CosyVoice 2?
CosyVoice 2, lanzado por el equipo FunAudioLLM de Alibaba en diciembre de 2024, combina un LLM con flow matching causal consciente de chunks. Con solo tres segundos de audio de referencia reproduce timbre, emoción y respiración, genera audio de alta resolución en tiempo real y admite síntesis multilingüe y code-switching. La cuantización finite-scalar codifica la señal en tokens discretos densos y separa información fonética y de timbre. El modelo funciona como un «GPT para voz», ofreciendo generación por lotes y streaming de latencia inferior a 150 ms en una sola canalización. En investigación convierte resúmenes y asesoramiento médico en audiolibros y doblajes en nueve idiomas conservando la voz del presentador. También permite controlar entonación, velocidad y emoción al narrar estructuras génicas o respuestas inmunes, mejorando accesibilidad.
¿Cuándo debería usar CosyVoice 2?
Motor open source de TTS en streaming y clonación de voz basado en deep learning
¿Cuál es un caso de uso biomédico de CosyVoice 2?
Aplicación práctica: CosyVoice 2, lanzado por el equipo FunAudioLLM de Alibaba en diciembre de 2024, combina un LLM con flow matching causal consciente de chunks. Con solo tres segundos de audio de referencia reproduce timbre, emoción y respiración, genera audio de alta resolución en tiempo real y admite síntesis multilingüe y code-switching. La cuantización finite-scalar codifica la señal en tokens discretos densos y separa información fonética y de timbre. El modelo funciona como un «GPT para voz», ofreciendo generación por lotes y streaming de latencia inferior a 150 ms en una sola canalización. En investigación convierte resúmenes y asesoramiento médico en audiolibros y doblajes en nueve idiomas conservando la voz del presentador. También permite controlar entonación, velocidad y emoción al narrar estructuras génicas o respuestas inmunes, mejorando accesibilidad.
📝 Notas de actualización
Aún no hay notas de actualización.
🧪 Código de la vida relacionado
Aún no hay publicaciones relacionadas de Código de la vida.