Herramientas de IA
IA de audioAvanzado

Fish Audio S2

Modelo de síntesis de voz de alta calidad con arquitectura Dual-AR y 4B parámetros.

Fish Audio S2 es un modelo TTS de código abierto publicado por Fish Audio en marzo de 2026. Es un generador de voz multilingüe que permite especificar en línea risa, susurros y tono de emisión profesional mediante más de 15.000 etiquetas emocionales.

Su arquitectura Dual-AR separa la predicción del libro de códigos semántico y del libro de códigos residual de voz, y acepta etiquetas de emoción y prosodia en lenguaje natural. Permite cambiar de tono dentro de una misma frase y obtuvo el primer puesto Bradley–Terry en evaluaciones ciegas.

Cubre más de 80 idiomas, crea clonación de voz zero-shot con 10–30 segundos de audio de referencia y ofrece inferencia en tiempo real con RTF 0,195 y TTFA aproximado de 100 ms en una H200.

💻 Requisitos del sistema

🧠RAM

Se recomiendan 24 GB para inferencia; el modo CPU es posible pero no permite tiempo real.

💾Almacenamiento

Checkpoint del modelo ~8–15 GB; paquete completo con dependencias ~20 GB.

Instalación

Inicio rápido

conda create -n fish-speech python=3.12
conda activate fish-speech
pip install -e .[cu129]

Dependencias y despliegue

apt install portaudio19-dev libsox-dev ffmpeg
uv sync --python 3.12 --extra cu129
git clone https://github.com/fishaudio/fish-speech.git
cd fish-speech
docker compose --profile webui up
docker compose --profile server up

Ejemplo

fish-speech infer --text "Hola" --reference ./ref_audio.wav

🧬 Casos de uso en biociencias

🔬

Síntesis de voz multilingüe en tiempo real

Procese más de 80 idiomas con un único modelo para localización global y genere doblaje automático tras clonar un hablante con 10 segundos de audio.

🧬

Audiolibros y pódcast con emoción

Use etiquetas en línea como [whispers], [excited] y [laugh] para crear narración expresiva y diálogos con varios hablantes.

💊

Generación de datos de voz para investigación

Genere audio sintético de alta calidad para aumentar datos de entrenamiento ASR, crear corpus multilingües y prototipar interfaces de voz.

FAQ

¿Qué es Fish Audio S2?

Fish Audio S2 es un modelo TTS de código abierto publicado por Fish Audio en marzo de 2026. Es un generador de voz multilingüe que permite especificar en línea risa, susurros y tono de emisión profesional mediante más de 15.000 etiquetas emocionales. Su arquitectura Dual-AR separa la predicción del libro de códigos semántico y del libro de códigos residual de voz, y acepta etiquetas de emoción y prosodia en lenguaje natural. Permite cambiar de tono dentro de una misma frase y obtuvo el primer puesto Bradley–Terry en evaluaciones ciegas. Cubre más de 80 idiomas, crea clonación de voz zero-shot con 10–30 segundos de audio de referencia y ofrece inferencia en tiempo real con RTF 0,195 y TTFA aproximado de 100 ms en una H200.

¿Cuándo debería usar Fish Audio S2?

Modelo de síntesis de voz de alta calidad con arquitectura Dual-AR y 4B parámetros.

¿Cuál es un caso de uso biomédico de Fish Audio S2?

Síntesis de voz multilingüe en tiempo real: Procese más de 80 idiomas con un único modelo para localización global y genere doblaje automático tras clonar un hablante con 10 segundos de audio.

📄 Documentación oficial🐙 GitHub

📝 Notas de actualización

Aún no hay notas de actualización.

🧪 Código de la vida relacionado

Aún no hay publicaciones relacionadas de Código de la vida.