Herramientas de IA
IA de audioIntermedio

CosyVoice 2

Motor open source de TTS en streaming y clonación de voz basado en deep learning

CosyVoice 2, lanzado por el equipo FunAudioLLM de Alibaba en diciembre de 2024, combina un LLM con flow matching causal consciente de chunks. Con solo tres segundos de audio de referencia reproduce timbre, emoción y respiración, genera audio de alta resolución en tiempo real y admite síntesis multilingüe y code-switching.

La cuantización finite-scalar codifica la señal en tokens discretos densos y separa información fonética y de timbre. El modelo funciona como un «GPT para voz», ofreciendo generación por lotes y streaming de latencia inferior a 150 ms en una sola canalización.

En investigación convierte resúmenes y asesoramiento médico en audiolibros y doblajes en nueve idiomas conservando la voz del presentador. También permite controlar entonación, velocidad y emoción al narrar estructuras génicas o respuestas inmunes, mejorando accesibilidad.

💻 Requisitos del sistema

🧠RAM

Se recomienda GPU NVIDIA de 8 GB o más para streaming en tiempo real; CPU aumenta mucho la latencia.

💾Almacenamiento

Al menos 5 GB; el modelo CosyVoice2-0.5B ocupa ~1 GB.

Instalación

4-1. Inicio rápido

git clone --recursive https://github.com/FunAudioLLM/CosyVoice.git
cd CosyVoice
conda create -n cosyvoice -y python=3.10 && conda activate cosyvoice
pip install -r requirements.txt

4-2. Instalación detallada

sudo apt-get install sox libsox-dev -y
conda create -n cosyvoice -y python=3.10
conda activate cosyvoice
conda install -y -c conda-forge pynini==2.1.5
pip install -r requirements.txt
python3 -c "from huggingface_hub import snapshot_download; snapshot_download('FunAudioLLM/CosyVoice2-0.5B', local_dir='pretrained_models/CosyVoice2-0.5B')"

🧬 Casos de uso en biociencias

🔬

Aplicación práctica

CosyVoice 2, lanzado por el equipo FunAudioLLM de Alibaba en diciembre de 2024, combina un LLM con flow matching causal consciente de chunks. Con solo tres segundos de audio de referencia reproduce timbre, emoción y respiración, genera audio de alta resolución en tiempo real y admite síntesis multilingüe y code-switching.

La cuantización finite-scalar codifica la señal en tokens discretos densos y separa información fonética y de timbre. El modelo funciona como un «GPT para voz», ofreciendo generación por lotes y streaming de latencia inferior a 150 ms en una sola canalización.

En investigación convierte resúmenes y asesoramiento médico en audiolibros y doblajes en nueve idiomas conservando la voz del presentador. También permite controlar entonación, velocidad y emoción al narrar estructuras génicas o respuestas inmunes, mejorando accesibilidad.

FAQ

¿Qué es CosyVoice 2?

CosyVoice 2, lanzado por el equipo FunAudioLLM de Alibaba en diciembre de 2024, combina un LLM con flow matching causal consciente de chunks. Con solo tres segundos de audio de referencia reproduce timbre, emoción y respiración, genera audio de alta resolución en tiempo real y admite síntesis multilingüe y code-switching. La cuantización finite-scalar codifica la señal en tokens discretos densos y separa información fonética y de timbre. El modelo funciona como un «GPT para voz», ofreciendo generación por lotes y streaming de latencia inferior a 150 ms en una sola canalización. En investigación convierte resúmenes y asesoramiento médico en audiolibros y doblajes en nueve idiomas conservando la voz del presentador. También permite controlar entonación, velocidad y emoción al narrar estructuras génicas o respuestas inmunes, mejorando accesibilidad.

¿Cuándo debería usar CosyVoice 2?

Motor open source de TTS en streaming y clonación de voz basado en deep learning

¿Cuál es un caso de uso biomédico de CosyVoice 2?

Aplicación práctica: CosyVoice 2, lanzado por el equipo FunAudioLLM de Alibaba en diciembre de 2024, combina un LLM con flow matching causal consciente de chunks. Con solo tres segundos de audio de referencia reproduce timbre, emoción y respiración, genera audio de alta resolución en tiempo real y admite síntesis multilingüe y code-switching. La cuantización finite-scalar codifica la señal en tokens discretos densos y separa información fonética y de timbre. El modelo funciona como un «GPT para voz», ofreciendo generación por lotes y streaming de latencia inferior a 150 ms en una sola canalización. En investigación convierte resúmenes y asesoramiento médico en audiolibros y doblajes en nueve idiomas conservando la voz del presentador. También permite controlar entonación, velocidad y emoción al narrar estructuras génicas o respuestas inmunes, mejorando accesibilidad.

📄 Documentación oficial🐙 GitHub

📝 Notas de actualización

Aún no hay notas de actualización.

🧪 Código de la vida relacionado

Aún no hay publicaciones relacionadas de Código de la vida.