Herramientas de IA
IA de audioIntermedio

TADA (Text-Acoustic Dual Alignment)

Model de TTS de alta calidad basado en la sincronización dual de texto y audio token a token 1:1.

  • Sincronización Dual de Texto-Acústico (1:1 Tokens): Sincroniza tokens de texto y vectores de audio de manera 1:1 para eliminar problemáticas del TTS como omisiones, repeticiones y hiato a nivel de arquitectura, logrando una falacia de contenido cero en más de 1,000 entradas de LibriTTSR.
  • Velocidad de inferencia 5 veces más rápida: RTF de 0.09, lo que significa una velocidad aproximadamente 5 veces más rápida que los modelos TTS basados en LLM equivalentes. Mientras que sistemas anteriores procesan entre 12.5 y 75 tokens de audio por segundo, TADA opera con 2-3 frames/segundo manteniendo una sinteización de audio de alta calidad. H100 con utilización de caché reduce RTF hasta ~0.12x.
  • Ficha de Contexto 10 veces más eficiente: Con una ventana de contexto de 2,048 tokens, cubre aproximadamente 700 segundos (~11.7 minutos) de audio, lo que es 10 veces más eficiente que sistemas anteriores que cubren unos 70 segundos. Es especialmente beneficioso para la lectura extensa, audiolibros y generación de conversaciones largas.
  • Soporte multilingüe (10 idiomas): Soporte para inglés, árabe, chino, alemán, español, francés, italiano, japonés, polaco y portugués utilizando modelos de 3B-ML. Ampliable con módulos aligner por idioma.
  • Generación Dual-Stream: Genera simultáneamente texto y audio, con Speech Free Guidance para controlar la calidad del habla mediante blending de logit.
  • Caché de flujo basado en inferencia: Utiliza EncoderOutput.save()/load() para almacenar resultados de codificación de audio de referencia, ahorrando ~2.5GB de VRAM en inferencias repetitivas y mejorando la velocidad.
  • Decodificación basada en Matching de Flujos: Restauración de audio de alta fidelidad mediante un flow-matching head condicionalizado en el estado ocultó del LLM, reduciendo los pasos de matching de flujo de 20→10 para una velocidad adicional del ~1.3 veces sin sacrificar la calidad.

💻 Requisitos del sistema

🧠RAM

Para el modelo 3B-ML con precisión bf16, requiere alrededor de 9GB de RAM. Es necesario un GPU compatible con CUDA, como el RTX 3060 (12GB) para ejecutar el modelo 3B en bf16, mientras que el modelo 1B puede funcionar con menos VRAM.

💾Almacenamiento

Peso del modelo 3B-ML ~8GB, 1B ~2GB, y codec (tada-codec) ~500MB. Paquete total aproximado de 10-12GB.

Instalación

Inicio Rápido

pip install hume-tada

Compilación de Fuente

git clone https://github.com/HumeAI/tada.git
cd tada
pip install -e .

Uso Básico (Python)

from tada.modules.encoder import Encoder
from tada.modules.tada import TadaForCausalLM
import torch, torchaudio

# Carga del modelo (3B multilingüe, precisión bf16)
encoder = Encoder.from_pretrained("HumeAI/tada-codec",
    subfolder="encoder").to("cuda")
model = TadaForCausalLM.from_pretrained("HumeAI/tada-3b-ml",
    torch_dtype=torch.bfloat16).to("cuda")

# Prompt con estilo de hablante de audio de referencia
audio, sr = torchaudio.load("reference.wav")
prompt = encoder(audio, text=["texto de referencia"], sample_rate=sr)

# Sintetización de nuevo texto
output = model.generate(prompt=prompt, text="texto a sintetizar")

Nota: Debe aceptar el Licencia de Comunidad de Meta Llama 3.2 en HuggingFace para descargar los pesos del modelo.

🧬 Casos de uso en biociencias

🧬

Generación de Contenido Audio

Optimizado para la creación de audiolibros, narraciones extensas y conversaciones de larga duración, garantizando calidad de audio superior.

🧬

Discovery de AGY (Assistive Generative Youth)

Facilita la creación de contenido personalizado para jóvenes con discapacidades, mejorando la interacción y la comunicación mediante audio adaptado.

FAQ

¿Qué es TADA (Text-Acoustic Dual Alignment)?

Sincronización Dual de Texto-Acústico (1:1 Tokens): Sincroniza tokens de texto y vectores de audio de manera 1:1 para eliminar problemáticas del TTS como omisiones, repeticiones y hiato a nivel de arquitectura, logrando una falacia de contenido cero en más de 1,000 entradas de LibriTTSR. Velocidad de inferencia 5 veces más rápida: RTF de 0.09, lo que significa una velocidad aproximadamente 5 veces más rápida que los modelos TTS basados en LLM equivalentes. Mientras que sistemas anteriores procesan entre 12.5 y 75 tokens de audio por segundo, TADA opera con 2-3 frames/segundo manteniendo una sinteización de audio de alta calidad. H100 con utilización de caché reduce RTF hasta ~0.12x. Ficha de Contexto 10 veces más eficiente: Con una ventana de contexto de 2,048 tokens, cubre aproximadamente 700 segundos (~11.7 minutos) de audio, lo que es 10 veces más eficiente que sistemas anteriores que cubren unos 70 segundos. Es especialmente beneficioso para la lectura extensa, audiolibros y generación de conversaciones largas. Soporte multilingüe (10 idiomas): Soporte para inglés, árabe, chino, alemán, español, francés, italiano, japonés, polaco y portugués utilizando modelos de 3B-ML. Ampliable con módulos aligner por idioma. Generación Dual-Stream: Genera simultáneamente texto y audio, con Speech Free Guidance para controlar la calidad del habla mediante blending de logit. Caché de flujo basado en inferencia: Utiliza EncoderOutput.save()/load() para almacenar resultados de codificación de audio de referencia, ahorrando ~2.5GB de VRAM en inferencias repetitivas y mejorando la velocidad. Decodificación basada en Matching de Flujos: Restauración de audio de alta fidelidad mediante un flow-matching head condicionalizado en el estado ocultó del LLM, reduciendo los pasos de matching de flujo de 20→10 para una velocidad adicional del ~1.3 veces sin sacrificar la calidad.

¿Cuándo debería usar TADA (Text-Acoustic Dual Alignment)?

Model de TTS de alta calidad basado en la sincronización dual de texto y audio token a token 1:1.

¿Cuál es un caso de uso biomédico de TADA (Text-Acoustic Dual Alignment)?

Generación de Contenido Audio: Optimizado para la creación de audiolibros, narraciones extensas y conversaciones de larga duración, garantizando calidad de audio superior.

📄 Documentación oficial🐙 GitHub

📝 Notas de actualización

Aún no hay notas de actualización.

🧪 Código de la vida relacionado

Aún no hay publicaciones relacionadas de Código de la vida.