Herramientas de IA
IA de audioPrincipiante

Kokoro-82M

Modelo TTS open-weight ultraligero de 82 millones de parámetros para audio de alta calidad

Kokoro-82M, publicado por el equipo hexgrad en enero de 2025, combina StyleTTS 2 e ISTFTNet para producir audio de calidad de estudio a 24 kHz con solo 82 millones de parámetros. Admite ocho idiomas, incluido español, y más de 54 voces predefinidas. Su tamaño aproximado de 330 MB permite inferencia en tiempo real incluso con CPU, superando las limitaciones de latencia y memoria de modelos TTS grandes. Es adecuado para avisos de laboratorio, resúmenes de artículos y contenidos educativos multilingües.

💻 Requisitos del sistema

🧠RAM

0 (funciona con CPU); se recomiendan 2 GB o más con GPU NVIDIA y también funciona con menos de 2 GB de VRAM

💾Almacenamiento

Unos 330 MB para pesos; menos de 1 GB para todo el entorno Python

Instalación

4-1. Inicio rápido

pip install kokoro soundfile torch

4-2. Instalación detallada

Instalar espeak-ng para fonemización Ubuntu/Debian:

sudo apt-get update && sudo apt-get install -y espeak-ng

macOS:

brew install espeak-ng

Instalar paquetes Python

pip install kokoro soundfile torch

Ejemplo básico en Python

from kokoro import KPipeline import soundfile as sf

pipeline = KPipeline(lang_code='a') text = "Kokoro is an open-weight 82M text-to-speech model." generator = pipeline(text, voice='af_heart', speed=1.0)

for i, (gs, ps, audio) in enumerate(generator): sf.write(f'output_{i}.wav', audio, 24000) print(f"Generated output_{i}.wav")

🧬 Casos de uso en biociencias

🔬

Sistema de briefing hablado para artículos y protocolos

Convierte resúmenes de PubMed o bioRxiv y protocolos offline en audio de 24 kHz para escuchar informes durante los desplazamientos.

🧬

Asistente de alertas para monitorización de laboratorio

Entrega feedback de voz de baja latencia sobre el estado y errores de equipos de muestreo o pipelines automáticos en un agente edge.

💊

Audio multilingüe para presentaciones y formación

Convierte guiones académicos en inglés, japonés o chino a 54 voces y tonos para presentaciones y contenidos educativos globales.

FAQ

¿Qué es Kokoro-82M?

Kokoro-82M, publicado por el equipo hexgrad en enero de 2025, combina StyleTTS 2 e ISTFTNet para producir audio de calidad de estudio a 24 kHz con solo 82 millones de parámetros. Admite ocho idiomas, incluido español, y más de 54 voces predefinidas. Su tamaño aproximado de 330 MB permite inferencia en tiempo real incluso con CPU, superando las limitaciones de latencia y memoria de modelos TTS grandes. Es adecuado para avisos de laboratorio, resúmenes de artículos y contenidos educativos multilingües.

¿Cuándo debería usar Kokoro-82M?

Modelo TTS open-weight ultraligero de 82 millones de parámetros para audio de alta calidad

¿Cuál es un caso de uso biomédico de Kokoro-82M?

Sistema de briefing hablado para artículos y protocolos: Convierte resúmenes de PubMed o bioRxiv y protocolos offline en audio de 24 kHz para escuchar informes durante los desplazamientos.

📄 Documentación oficial🐙 GitHub

📝 Notas de actualización

Aún no hay notas de actualización.

🧪 Código de la vida relacionado

Aún no hay publicaciones relacionadas de Código de la vida.