Step-Audio-EditX
Modelo de edición y generación de audio de 3B parámetros con RL, basado en tokenizer de doble código y decoder de flow matching
Step-Audio-EditX, de la startup china StepFun, combina tokenizer de audio de doble código, un LLM de audio y un decodificador flow matching para editar contenido lingüístico, emoción, tono, respiración, tos y risa. Incorpora DPO y GRPO para conservar continuidad y calidad sin modelos auxiliares, con clonación de voz zero-shot y control emocional.
En biotecnología permite estandarizar respiración, risa y carraspeo de participantes, sintetizar voces emocionales para estudios de salud mental y simular patrones de trastornos de la voz con audios de hasta 30 segundos, alimentando canalizaciones de biomarcadores digitales.
💻 Requisitos del sistema
GPU NVIDIA de al menos 12 GB para FP16/BF16; se recomiendan 24 GB o más.
Pesos ~6 GB; al menos 15 GB con componentes y caché.
⚡ Instalación
4-1. Inicio rápido
git clone https://github.com/stepfun-ai/Step-Audio-EditX.git
cd Step-Audio-EditX
pip install -r requirements.txt
4-2. Instalación detallada
conda create -n stepaudioedit python=3.10 -y
conda activate stepaudioedit
git clone https://github.com/stepfun-ai/Step-Audio-EditX.git
cd Step-Audio-EditX
pip install -r requirements.txt
pip install huggingface_hub
huggingface-cli download stepfun-ai/Step-Audio-EditX --local-dir ./checkpoints/Step-Audio-EditX
huggingface-cli download stepfun-ai/Step-Audio-Tokenizer --local-dir ./checkpoints/Step-Audio-Tokenizer
python infer.py --model_path ./checkpoints/Step-Audio-EditX --prompt_audio input.wav --text "Texto que se desea editar"
🧬 Casos de uso en biociencias
Investigación de biomarcadores vocales en salud digital
Controlar emoción y rasgos paralingüísticos (respiración, temblor, carraspeo) para sintetizar datasets de voz estímulo destinados al diagnóstico respiratorio y neurológico y alimentar una canalización de biomarcadores.
Pacientes virtuales multie mocionales para formación clínica
Generar en tiempo real tonos de ansiedad, ira o tristeza y sonidos fisiológicos mediante clonación zero-shot desde tres segundos de referencia, para simuladores interactivos de conversación médica.
Voces para contenidos médicos y académicos
Ajustar pronunciación y énfasis emocional al generar explicaciones de terminología médica y artículos, creando briefings de audio personalizados para investigación y educación.
FAQ
¿Qué es Step-Audio-EditX?
Step-Audio-EditX, de la startup china StepFun, combina tokenizer de audio de doble código, un LLM de audio y un decodificador flow matching para editar contenido lingüístico, emoción, tono, respiración, tos y risa. Incorpora DPO y GRPO para conservar continuidad y calidad sin modelos auxiliares, con clonación de voz zero-shot y control emocional. En biotecnología permite estandarizar respiración, risa y carraspeo de participantes, sintetizar voces emocionales para estudios de salud mental y simular patrones de trastornos de la voz con audios de hasta 30 segundos, alimentando canalizaciones de biomarcadores digitales.
¿Cuándo debería usar Step-Audio-EditX?
Modelo de edición y generación de audio de 3B parámetros con RL, basado en tokenizer de doble código y decoder de flow matching
¿Cuál es un caso de uso biomédico de Step-Audio-EditX?
Investigación de biomarcadores vocales en salud digital: Controlar emoción y rasgos paralingüísticos (respiración, temblor, carraspeo) para sintetizar datasets de voz estímulo destinados al diagnóstico respiratorio y neurológico y alimentar una canalización de biomarcadores.
📝 Notas de actualización
Aún no hay notas de actualización.
🧪 Código de la vida relacionado
Aún no hay publicaciones relacionadas de Código de la vida.