Herramientas de IA
IA de audioIntermedio

Step-Audio-EditX

Modelo de edición y generación de audio de 3B parámetros con RL, basado en tokenizer de doble código y decoder de flow matching

Step-Audio-EditX, de la startup china StepFun, combina tokenizer de audio de doble código, un LLM de audio y un decodificador flow matching para editar contenido lingüístico, emoción, tono, respiración, tos y risa. Incorpora DPO y GRPO para conservar continuidad y calidad sin modelos auxiliares, con clonación de voz zero-shot y control emocional.

En biotecnología permite estandarizar respiración, risa y carraspeo de participantes, sintetizar voces emocionales para estudios de salud mental y simular patrones de trastornos de la voz con audios de hasta 30 segundos, alimentando canalizaciones de biomarcadores digitales.

💻 Requisitos del sistema

🧠RAM

GPU NVIDIA de al menos 12 GB para FP16/BF16; se recomiendan 24 GB o más.

💾Almacenamiento

Pesos ~6 GB; al menos 15 GB con componentes y caché.

Instalación

4-1. Inicio rápido

git clone https://github.com/stepfun-ai/Step-Audio-EditX.git
cd Step-Audio-EditX
pip install -r requirements.txt

4-2. Instalación detallada

conda create -n stepaudioedit python=3.10 -y
conda activate stepaudioedit
git clone https://github.com/stepfun-ai/Step-Audio-EditX.git
cd Step-Audio-EditX
pip install -r requirements.txt
pip install huggingface_hub
huggingface-cli download stepfun-ai/Step-Audio-EditX --local-dir ./checkpoints/Step-Audio-EditX
huggingface-cli download stepfun-ai/Step-Audio-Tokenizer --local-dir ./checkpoints/Step-Audio-Tokenizer
python infer.py --model_path ./checkpoints/Step-Audio-EditX --prompt_audio input.wav --text "Texto que se desea editar"

🧬 Casos de uso en biociencias

🔬

Investigación de biomarcadores vocales en salud digital

Controlar emoción y rasgos paralingüísticos (respiración, temblor, carraspeo) para sintetizar datasets de voz estímulo destinados al diagnóstico respiratorio y neurológico y alimentar una canalización de biomarcadores.

🧬

Pacientes virtuales multie mocionales para formación clínica

Generar en tiempo real tonos de ansiedad, ira o tristeza y sonidos fisiológicos mediante clonación zero-shot desde tres segundos de referencia, para simuladores interactivos de conversación médica.

💊

Voces para contenidos médicos y académicos

Ajustar pronunciación y énfasis emocional al generar explicaciones de terminología médica y artículos, creando briefings de audio personalizados para investigación y educación.

FAQ

¿Qué es Step-Audio-EditX?

Step-Audio-EditX, de la startup china StepFun, combina tokenizer de audio de doble código, un LLM de audio y un decodificador flow matching para editar contenido lingüístico, emoción, tono, respiración, tos y risa. Incorpora DPO y GRPO para conservar continuidad y calidad sin modelos auxiliares, con clonación de voz zero-shot y control emocional. En biotecnología permite estandarizar respiración, risa y carraspeo de participantes, sintetizar voces emocionales para estudios de salud mental y simular patrones de trastornos de la voz con audios de hasta 30 segundos, alimentando canalizaciones de biomarcadores digitales.

¿Cuándo debería usar Step-Audio-EditX?

Modelo de edición y generación de audio de 3B parámetros con RL, basado en tokenizer de doble código y decoder de flow matching

¿Cuál es un caso de uso biomédico de Step-Audio-EditX?

Investigación de biomarcadores vocales en salud digital: Controlar emoción y rasgos paralingüísticos (respiración, temblor, carraspeo) para sintetizar datasets de voz estímulo destinados al diagnóstico respiratorio y neurológico y alimentar una canalización de biomarcadores.

📄 Documentación oficial🐙 GitHub

📝 Notas de actualización

Aún no hay notas de actualización.

🧪 Código de la vida relacionado

Aún no hay publicaciones relacionadas de Código de la vida.