VoxCPM2
Modelo de síntesis de voz de nueva generación, open source, que genera habla natural en un espacio acústico continuo
VoxCPM2, publicado por OpenBMB en abril de 2026, genera voz natural en un espacio acústico continuo. Conecta el backbone MiniCPM con un codificador de audio de alta resolución y adopta una arquitectura sin tokenizador que reconstruye directamente la forma de onda, ofreciendo audio de calidad de estudio a 48 kHz incluso localmente. Permite diseñar voces a partir de descripciones textuales y clonar una voz con un breve clip (zero-shot). Admite más de 30 idiomas, streaming en tiempo real y ajuste fino LoRA para aprender características de un hablante.
💻 Requisitos del sistema
Mínimo 8 GB (se recomienda una GPU NVIDIA de consumo como RTX 3060); admite CPU y MPS
Al menos 10 GB para pesos del modelo y dependencias
⚡ Instalación
4-1. Inicio rápido
pip install voxcpm
4-2. Instalación detallada
# Clonar el repositorio e instalar dependencias
git clone https://github.com/OpenBMB/VoxCPM.git
cd VoxCPM
pip install -r requirements.txt
# (Opcional) Ejecutar la interfaz web para ajuste fino LoRA
python lora_ft_webui.py
🧬 Casos de uso en biociencias
Bot de voz multilingüe y síntesis en streaming
Usa la API de VoxCPM2 con inference_timesteps=10 para generar guiones en 30 idiomas como audio de 48 kHz en tiempo real y crear una interfaz de voz para asistentes globales.
Clonación zero-shot y diseño de voz para audiolibros
Configura un clip de voz de 15 segundos como prompt_wav_path y renderiza un manuscrito de una hora conservando el timbre y el tono emocional del hablante.
Voz de marca mediante ajuste fino LoRA especializado
Ajusta el modelo durante 20 épocas con una hora de grabaciones y guiones de un locutor para obtener una voz de estudio de 48 kHz adaptada a la identidad de marca.
FAQ
¿Qué es VoxCPM2?
VoxCPM2, publicado por OpenBMB en abril de 2026, genera voz natural en un espacio acústico continuo. Conecta el backbone MiniCPM con un codificador de audio de alta resolución y adopta una arquitectura sin tokenizador que reconstruye directamente la forma de onda, ofreciendo audio de calidad de estudio a 48 kHz incluso localmente. Permite diseñar voces a partir de descripciones textuales y clonar una voz con un breve clip (zero-shot). Admite más de 30 idiomas, streaming en tiempo real y ajuste fino LoRA para aprender características de un hablante.
¿Cuándo debería usar VoxCPM2?
Modelo de síntesis de voz de nueva generación, open source, que genera habla natural en un espacio acústico continuo
¿Cuál es un caso de uso biomédico de VoxCPM2?
Bot de voz multilingüe y síntesis en streaming: Usa la API de VoxCPM2 con inference_timesteps=10 para generar guiones en 30 idiomas como audio de 48 kHz en tiempo real y crear una interfaz de voz para asistentes globales.
📝 Notas de actualización
Aún no hay notas de actualización.
🧪 Código de la vida relacionado
Aún no hay publicaciones relacionadas de Código de la vida.