Herramientas de IA
IA de audioIntermedio

VoxCPM2

Modelo de síntesis de voz de nueva generación, open source, que genera habla natural en un espacio acústico continuo

VoxCPM2, publicado por OpenBMB en abril de 2026, genera voz natural en un espacio acústico continuo. Conecta el backbone MiniCPM con un codificador de audio de alta resolución y adopta una arquitectura sin tokenizador que reconstruye directamente la forma de onda, ofreciendo audio de calidad de estudio a 48 kHz incluso localmente. Permite diseñar voces a partir de descripciones textuales y clonar una voz con un breve clip (zero-shot). Admite más de 30 idiomas, streaming en tiempo real y ajuste fino LoRA para aprender características de un hablante.

💻 Requisitos del sistema

🧠RAM

Mínimo 8 GB (se recomienda una GPU NVIDIA de consumo como RTX 3060); admite CPU y MPS

💾Almacenamiento

Al menos 10 GB para pesos del modelo y dependencias

Instalación

4-1. Inicio rápido

pip install voxcpm

4-2. Instalación detallada

# Clonar el repositorio e instalar dependencias
git clone https://github.com/OpenBMB/VoxCPM.git
cd VoxCPM
pip install -r requirements.txt

# (Opcional) Ejecutar la interfaz web para ajuste fino LoRA
python lora_ft_webui.py

🧬 Casos de uso en biociencias

🎙️

Bot de voz multilingüe y síntesis en streaming

Usa la API de VoxCPM2 con inference_timesteps=10 para generar guiones en 30 idiomas como audio de 48 kHz en tiempo real y crear una interfaz de voz para asistentes globales.

📖

Clonación zero-shot y diseño de voz para audiolibros

Configura un clip de voz de 15 segundos como prompt_wav_path y renderiza un manuscrito de una hora conservando el timbre y el tono emocional del hablante.

🎯

Voz de marca mediante ajuste fino LoRA especializado

Ajusta el modelo durante 20 épocas con una hora de grabaciones y guiones de un locutor para obtener una voz de estudio de 48 kHz adaptada a la identidad de marca.

FAQ

¿Qué es VoxCPM2?

VoxCPM2, publicado por OpenBMB en abril de 2026, genera voz natural en un espacio acústico continuo. Conecta el backbone MiniCPM con un codificador de audio de alta resolución y adopta una arquitectura sin tokenizador que reconstruye directamente la forma de onda, ofreciendo audio de calidad de estudio a 48 kHz incluso localmente. Permite diseñar voces a partir de descripciones textuales y clonar una voz con un breve clip (zero-shot). Admite más de 30 idiomas, streaming en tiempo real y ajuste fino LoRA para aprender características de un hablante.

¿Cuándo debería usar VoxCPM2?

Modelo de síntesis de voz de nueva generación, open source, que genera habla natural en un espacio acústico continuo

¿Cuál es un caso de uso biomédico de VoxCPM2?

Bot de voz multilingüe y síntesis en streaming: Usa la API de VoxCPM2 con inference_timesteps=10 para generar guiones en 30 idiomas como audio de 48 kHz en tiempo real y crear una interfaz de voz para asistentes globales.

📄 Documentación oficial🐙 GitHub

📝 Notas de actualización

Aún no hay notas de actualización.

🧪 Código de la vida relacionado

Aún no hay publicaciones relacionadas de Código de la vida.