Herramientas de IA
IA de audioIntermedio

Dia2

Modelo TTS conversacional interactivo con generación en streaming

Dia2, desarrollado por Nari Labs, es un modelo de síntesis de voz interactiva en streaming. Al igual que GPT genera texto token a token, Dia2 comienza a generar audio inmediatamente incluso cuando solo se proporcionan las primeras palabras del texto de entrada. Está disponible en tamaños de 1B y 2B parámetros y, construido sobre el códec de audio Mimi de Kyutai, utiliza una arquitectura de decodificación paralela inspirada en la investigación SoundStorm de Google.

La mayoría de los modelos TTS existentes deben recibir primero el texto completo para generar audio. En sistemas de conversación en tiempo real o aplicaciones interactivas, esta latencia es un cuello de botella crítico. Dia2 supera esa limitación mediante la generación en streaming. Las etiquetas de hablante [S1] y [S2] permiten guionizar naturalmente conversaciones con varios hablantes, incluida la generación de vocalizaciones no verbales como risas, tos, suspiros y jadeos. Al condicionarlo con audio de prefijo puede clonar el timbre y el tono emocional de un hablante concreto, resolviendo el problema de las voces aleatorias que cambian en cada generación.

En biotecnología, Dia2 puede generar automáticamente guías de audio para protocolos experimentales. Por ejemplo, al convertir un protocolo de cultivo celular en un diálogo entre [S1] y [S2], se pueden escuchar instrucciones paso a paso sin usar las manos mientras se trabaja en una cabina de flujo laminar. También permite prototipar rápidamente voz conversacional en inglés de alta calidad para materiales educativos de pacientes, podcasts de artículos y ensayos de presentaciones multilingües. Genera hasta dos minutos de audio en inglés y sigue mejorando la velocidad de inferencia mediante optimización de CUDA Graph y caché de RotaryEmbedding.

💻 Requisitos del sistema

🧠RAM

Se requiere GPU NVIDIA con CUDA 12.8 o superior. Se estiman 6-10 GB para el modelo 2B en bfloat16 y 4-6 GB para 1B (cifras oficiales no publicadas; como referencia, Dia original de 1.6B requiere ~4,4 GB en bf16 y ~7,9 GB en fp32).

💾Almacenamiento

Checkpoint del modelo 2B de ~4 GB (fp32), modelo 1B de ~2 GB; ~6-8 GB en total con dependencias.

Instalación

4-1. Inicio rápido

# Instalar el gestor de paquetes uv (si aún no está instalado)
curl -LsSf https://astral.sh/uv/install.sh | sh

# Clonar el repositorio y sincronizar dependencias
git clone https://github.com/nari-labs/dia2.git
cd dia2
uv sync

4-2. Uso básico

# Generar voz conversacional desde la CLI (modelo 2B)
uv run -m dia2.cli \\
  --hf nari-labs/Dia2-2B \\
  --input input.txt \\
  --cfg 6.0 --temperature 0.8 \\
  --cuda-graph --verbose \\
  output.wav
# Clonación de voz: generación condicionada por audio de prefijo
uv run -m dia2.cli \\
  --hf nari-labs/Dia2-2B \\
  --input input.txt \\
  --prefix-speaker-1 example_prefix1.wav \\
  --prefix-speaker-2 example_prefix2.wav \\
  --cuda-graph --verbose \\
  output_conditioned.wav
# API de Python
from dia2 import Dia2, GenerationConfig, SamplingConfig

dia = Dia2.from_repo("nari-labs/Dia2-2B", device="cuda", dtype="bfloat16")
config = GenerationConfig(
    cfg_scale=2.0,
    audio=SamplingConfig(temperature=0.8, top_k=50),
    use_cuda_graph=True
)
result = dia.generate(
    "[S1] Hello Dia2!",
    config=config,
    output_wav="hello.wav",
    verbose=True
)

🧬 Casos de uso en biociencias

🔬

Guía de audio para protocolos experimentales

Convertir protocolos de cultivo celular y preparación de reactivos en un diálogo entre [S1] (instructor) y [S2] (verificador), para escucharlo sin manos durante el trabajo en cabina o campana. Generar voz clara con cfg_scale=6.0 y temperature=0.7, fijando un tono familiar mediante audio de prefijo.

🧬

Conversión automática de artículos a podcast

Guionizar el Abstract y la Discussion de un artículo como debate entre dos investigadores y convertirlo con Dia2. Generar dos minutos de audio para asimilar artículos durante los desplazamientos o al correr, con vocalizaciones no verbales que aportan naturalidad.

💊

Contenido de audio educativo para pacientes

Convertir explicaciones de resultados de pruebas genéticas y resúmenes de consentimientos de ensayos clínicos en diálogos comprensibles para pacientes. Mantener la voz del profesional mediante clonación para crear material educativo fiable; prototipar con 1B y finalizar con 2B.

FAQ

¿Qué es Dia2?

Dia2, desarrollado por Nari Labs, es un modelo de síntesis de voz interactiva en streaming. Al igual que GPT genera texto token a token, Dia2 comienza a generar audio inmediatamente incluso cuando solo se proporcionan las primeras palabras del texto de entrada. Está disponible en tamaños de 1B y 2B parámetros y, construido sobre el códec de audio Mimi de Kyutai, utiliza una arquitectura de decodificación paralela inspirada en la investigación SoundStorm de Google. La mayoría de los modelos TTS existentes deben recibir primero el texto completo para generar audio. En sistemas de conversación en tiempo real o aplicaciones interactivas, esta latencia es un cuello de botella crítico. Dia2 supera esa limitación mediante la generación en streaming. Las etiquetas de hablante [S1] y [S2] permiten guionizar naturalmente conversaciones con varios hablantes, incluida la generación de vocalizaciones no verbales como risas, tos, suspiros y jadeos. Al condicionarlo con audio de prefijo puede clonar el timbre y el tono emocional de un hablante concreto, resolviendo el problema de las voces aleatorias que cambian en cada generación. En biotecnología, Dia2 puede generar automáticamente guías de audio para protocolos experimentales. Por ejemplo, al convertir un protocolo de cultivo celular en un diálogo entre [S1] y [S2], se pueden escuchar instrucciones paso a paso sin usar las manos mientras se trabaja en una cabina de flujo laminar. También permite prototipar rápidamente voz conversacional en inglés de alta calidad para materiales educativos de pacientes, podcasts de artículos y ensayos de presentaciones multilingües. Genera hasta dos minutos de audio en inglés y sigue mejorando la velocidad de inferencia mediante optimización de CUDA Graph y caché de RotaryEmbedding.

¿Cuándo debería usar Dia2?

Modelo TTS conversacional interactivo con generación en streaming

¿Cuál es un caso de uso biomédico de Dia2?

Guía de audio para protocolos experimentales: Convertir protocolos de cultivo celular y preparación de reactivos en un diálogo entre [S1] (instructor) y [S2] (verificador), para escucharlo sin manos durante el trabajo en cabina o campana. Generar voz clara con cfg_scale=6.0 y temperature=0.7, fijando un tono familiar mediante audio de prefijo.

📄 Documentación oficial🐙 GitHub

📝 Notas de actualización

Aún no hay notas de actualización.

🧪 Código de la vida relacionado

Aún no hay publicaciones relacionadas de Código de la vida.