Voxtral TTS
Modelo foundation TTS open-weight de Mistral AI con clonación de voz zero-shot y síntesis multilingüe
Voxtral TTS es un modelo de texto a voz de 4,1B parámetros publicado por Mistral AI en marzo de 2026. Combina un decodificador Transformer autorregresivo para tokens semánticos con flow matching para tokens acústicos, equilibrando velocidad y calidad. Con solo 2–3 segundos de audio de referencia reproduce el timbre, la respiración y el estilo del hablante, incluso entre idiomas. Desplegado con vLLM-Omni, ofrece una primera salida de audio cercana a 90 ms y admite nueve idiomas, por lo que sirve para asistentes médicos y guías de audio multilingües.
💻 Requisitos del sistema
Se recomienda una GPU NVIDIA de al menos 24 GB para inferencia FP16; 8 GB o más con cuantización o Apple Silicon
Aproximadamente 10–15 GB para pesos del modelo y embeddings
⚡ Instalación
4-1. Inicio rápido
Instalar vLLM-Omni y Mistral Commonpip install git+https://github.com/vllm-project/vllm-omni.git "mistral_common>=1.10.0"
4-2. Instalación detallada
1. Servir el modelo mediante el servidor acelerado vLLMvllm serve mistralai/Voxtral-4B-TTS-2603 --omni
2. Configurar la ejecución basada en MLX en Apple Silicongit clone https://github.com/redseaplume/Voxtral-4B-TTS-2603-MLX.git cd Voxtral-4B-TTS-2603-MLX pip install -e .
🧬 Casos de uso en biociencias
Bot médico y biotecnológico multilingüe en tiempo real
Despliega vLLM-Omni para usar la respuesta de baja latencia como agente de interpretación en reservas médicas y orientación sobre medicamentos.
Retroalimentación de investigación y estímulos auditivos
Sintetiza en masa estímulos de voz multilingües controlados por parámetros emocionales zero-shot para estudios cognitivos y conductuales.
Automatización de manuales y audiolibros multilingües
Traduce y sintetiza de forma coherente explicaciones de recetas y guías de procesos farmacéuticos en nueve idiomas, incluidos inglés y francés.
FAQ
¿Qué es Voxtral TTS?
Voxtral TTS es un modelo de texto a voz de 4,1B parámetros publicado por Mistral AI en marzo de 2026. Combina un decodificador Transformer autorregresivo para tokens semánticos con flow matching para tokens acústicos, equilibrando velocidad y calidad. Con solo 2–3 segundos de audio de referencia reproduce el timbre, la respiración y el estilo del hablante, incluso entre idiomas. Desplegado con vLLM-Omni, ofrece una primera salida de audio cercana a 90 ms y admite nueve idiomas, por lo que sirve para asistentes médicos y guías de audio multilingües.
¿Cuándo debería usar Voxtral TTS?
Modelo foundation TTS open-weight de Mistral AI con clonación de voz zero-shot y síntesis multilingüe
¿Cuál es un caso de uso biomédico de Voxtral TTS?
Bot médico y biotecnológico multilingüe en tiempo real: Despliega vLLM-Omni para usar la respuesta de baja latencia como agente de interpretación en reservas médicas y orientación sobre medicamentos.
📝 Notas de actualización
Aún no hay notas de actualización.
🧪 Código de la vida relacionado
Aún no hay publicaciones relacionadas de Código de la vida.