Kokoro-82M
Modelo TTS open-weight ultraligero de 82 millones de parámetros para audio de alta calidad
Kokoro-82M, publicado por el equipo hexgrad en enero de 2025, combina StyleTTS 2 e ISTFTNet para producir audio de calidad de estudio a 24 kHz con solo 82 millones de parámetros. Admite ocho idiomas, incluido español, y más de 54 voces predefinidas. Su tamaño aproximado de 330 MB permite inferencia en tiempo real incluso con CPU, superando las limitaciones de latencia y memoria de modelos TTS grandes. Es adecuado para avisos de laboratorio, resúmenes de artículos y contenidos educativos multilingües.
💻 Requisitos del sistema
0 (funciona con CPU); se recomiendan 2 GB o más con GPU NVIDIA y también funciona con menos de 2 GB de VRAM
Unos 330 MB para pesos; menos de 1 GB para todo el entorno Python
⚡ Instalación
4-1. Inicio rápido
pip install kokoro soundfile torch
4-2. Instalación detallada
Instalar espeak-ng para fonemización Ubuntu/Debian:sudo apt-get update && sudo apt-get install -y espeak-ng
macOS:brew install espeak-ng
Instalar paquetes Pythonpip install kokoro soundfile torch
Ejemplo básico en Pythonfrom kokoro import KPipeline import soundfile as sf
pipeline = KPipeline(lang_code='a') text = "Kokoro is an open-weight 82M text-to-speech model." generator = pipeline(text, voice='af_heart', speed=1.0)
for i, (gs, ps, audio) in enumerate(generator): sf.write(f'output_{i}.wav', audio, 24000) print(f"Generated output_{i}.wav")
🧬 Casos de uso en biociencias
Sistema de briefing hablado para artículos y protocolos
Convierte resúmenes de PubMed o bioRxiv y protocolos offline en audio de 24 kHz para escuchar informes durante los desplazamientos.
Asistente de alertas para monitorización de laboratorio
Entrega feedback de voz de baja latencia sobre el estado y errores de equipos de muestreo o pipelines automáticos en un agente edge.
Audio multilingüe para presentaciones y formación
Convierte guiones académicos en inglés, japonés o chino a 54 voces y tonos para presentaciones y contenidos educativos globales.
FAQ
¿Qué es Kokoro-82M?
Kokoro-82M, publicado por el equipo hexgrad en enero de 2025, combina StyleTTS 2 e ISTFTNet para producir audio de calidad de estudio a 24 kHz con solo 82 millones de parámetros. Admite ocho idiomas, incluido español, y más de 54 voces predefinidas. Su tamaño aproximado de 330 MB permite inferencia en tiempo real incluso con CPU, superando las limitaciones de latencia y memoria de modelos TTS grandes. Es adecuado para avisos de laboratorio, resúmenes de artículos y contenidos educativos multilingües.
¿Cuándo debería usar Kokoro-82M?
Modelo TTS open-weight ultraligero de 82 millones de parámetros para audio de alta calidad
¿Cuál es un caso de uso biomédico de Kokoro-82M?
Sistema de briefing hablado para artículos y protocolos: Convierte resúmenes de PubMed o bioRxiv y protocolos offline en audio de 24 kHz para escuchar informes durante los desplazamientos.
📝 Notas de actualización
Aún no hay notas de actualización.
🧪 Código de la vida relacionado
Aún no hay publicaciones relacionadas de Código de la vida.