Herramientas de IA
Flujo de trabajoIntermedio

ml-intern

Agente que automatiza todo el flujo de trabajo de ML, desde la búsqueda de artículos hasta el postentrenamiento

  • Automatización integral del postentrenamiento de ML: buscar artículos en arXiv → recorrer el grafo de citas → buscar, verificar la calidad y convertir datasets en Hugging Face Hub → ejecutar scripts SFT/GRPO → interpretar resultados → diagnosticar fallos (como reward collapse) y completar de forma autónoma todo el ciclo de investigación.
  • ContextManager (compresión automática de 170k tokens): compacta automáticamente el historial de mensajes al alcanzar 170k tokens para mantener estables las sesiones largas del agente. Sube automáticamente las trazas de sesión como datasets de HF.
  • Doom Loop Detector: detecta patrones repetitivos de llamadas a herramientas e inyecta prompts correctivos para evitar que el agente repita indefinidamente el mismo fallo. Combinado con un límite de 300 iteraciones, garantiza una ejecución autónoma segura.
  • ToolRouter: integra en una sola capa de enrutamiento la búsqueda de documentación/repositorios/datasets de Hugging Face, lectura de artículos arXiv, búsqueda de código en GitHub, ejecución en sandbox, planificación y herramientas de servidores MCP.
  • Aprobación previa de tareas de pago o destructivas: la ejecución de GPU Jobs (Hugging Face Jobs) y los comandos destructivos solo se realizan con aprobación explícita del usuario. Se puede configurar un flujo de autoaprobación.
  • Múltiples backends LLM: admite Claude (mediante FAL-AI), GPT (OpenAI/FAL-AI), modelos HF Router (MiniMax, Kimi, GLM, DeepSeek) y modelos locales (Ollama, vLLM, LM Studio, LlamaCPP).
  • Seguimiento de experimentos Trackio + alertas Slack: monitoriza métricas de entrenamiento con Trackio, el rastreador nativo del Hub, y notifica el progreso mediante una pasarela Slack.

💻 Requisitos del sistema

🧠RAM

El agente funciona solo con CPU (la inferencia LLM se delega a una API externa). Para ejecutar modelos locales (Ollama/vLLM), se requieren 8-24 GB según el tamaño del modelo. Se recomienda una H100 de 80 GB para SFT/GRPO, aunque puede delegarse en la nube mediante Hugging Face Jobs.

💾Almacenamiento

El paquete ocupa ~250 MB. Con datasets de entrenamiento y checkpoints, se requieren 10-50 GB por proyecto.

Instalación

4-1. Inicio rápido

pip install ml-intern

4-2. Instalación detallada (modo desarrollo)

git clone https://github.com/huggingface/ml-intern.git
cd ml-intern
uv sync
uv tool install -e .

4-3. Configuración de variables de entorno

export HF_TOKEN="hf_..."            # Token de Hugging Face (obligatorio)
export ANTHROPIC_API_KEY="sk-..."    # Para usar modelos Anthropic
export OPENAI_API_KEY="sk-..."       # Para usar modelos OpenAI
export GITHUB_TOKEN="ghp_..."        # Para buscar código en GitHub (opcional)

4-4. Uso básico

# Modo interactivo
ml-intern

# Modo headless (un solo prompt)
ml-intern --headless --task "Mejora Qwen3-1.7B en el benchmark GPQA"

# Dependencias opcionales
pip install ml-intern[eval]   # Herramientas de evaluación
pip install ml-intern[dev]    # Herramientas de desarrollo
pip install ml-intern[all]    # Todo

El estilo de código utiliza Ruff y se integra con endpoints de modelos locales mediante LiteLLM.

🧬 Casos de uso en biociencias

🔬

Automatización del postentrenamiento de LLM

Al especificar un modelo base (por ejemplo, Qwen3-1.7B), el agente busca artículos relevantes, explora y verifica datasets adecuados en Hub, ejecuta entrenamiento SFT o GRPO y evalúa con benchmarks como GPQA. Se ha informado de una mejora de Qwen3-1.7B en GPQA de aproximadamente 10 % a 32 % en una sesión de 10 horas con una H100, según PostTrainBench.

🧬

Investigación de ajuste fino especializado por dominio

Para dominios como medicina, matemáticas o derecho, el agente lee en arXiv metodologías recientes (GRPO, DPO, etc.), sigue el grafo de citas para encontrar trabajos relacionados, implementa las técnicas y las aplica al entrenamiento. Si falla, diagnostica causas como reward collapse, genera datos sintéticos de casos límite y reintenta.

💊

Experimentos reproducibles basados en artículos y evaluación a gran escala

Recorrer las secciones metodológicas y grafos de citas de artículos arXiv para recopilar datasets de referencia, localizar datos coincidentes en HF Hub, generar scripts de entrenamiento y reproducir experimentos. Registrar y comparar resultados con Trackio para múltiples checkpoints o combinaciones de hiperparámetros e identificar la configuración óptima.

FAQ

¿Qué es ml-intern?

Automatización integral del postentrenamiento de ML: buscar artículos en arXiv → recorrer el grafo de citas → buscar, verificar la calidad y convertir datasets en Hugging Face Hub → ejecutar scripts SFT/GRPO → interpretar resultados → diagnosticar fallos (como reward collapse) y completar de forma autónoma todo el ciclo de investigación. ContextManager (compresión automática de 170k tokens): compacta automáticamente el historial de mensajes al alcanzar 170k tokens para mantener estables las sesiones largas del agente. Sube automáticamente las trazas de sesión como datasets de HF. Doom Loop Detector: detecta patrones repetitivos de llamadas a herramientas e inyecta prompts correctivos para evitar que el agente repita indefinidamente el mismo fallo. Combinado con un límite de 300 iteraciones, garantiza una ejecución autónoma segura. ToolRouter: integra en una sola capa de enrutamiento la búsqueda de documentación/repositorios/datasets de Hugging Face, lectura de artículos arXiv, búsqueda de código en GitHub, ejecución en sandbox, planificación y herramientas de servidores MCP. Aprobación previa de tareas de pago o destructivas: la ejecución de GPU Jobs (Hugging Face Jobs) y los comandos destructivos solo se realizan con aprobación explícita del usuario. Se puede configurar un flujo de autoaprobación. Múltiples backends LLM: admite Claude (mediante FAL-AI), GPT (OpenAI/FAL-AI), modelos HF Router (MiniMax, Kimi, GLM, DeepSeek) y modelos locales (Ollama, vLLM, LM Studio, LlamaCPP). Seguimiento de experimentos Trackio + alertas Slack: monitoriza métricas de entrenamiento con Trackio, el rastreador nativo del Hub, y notifica el progreso mediante una pasarela Slack.

¿Cuándo debería usar ml-intern?

Agente que automatiza todo el flujo de trabajo de ML, desde la búsqueda de artículos hasta el postentrenamiento

¿Cuál es un caso de uso biomédico de ml-intern?

Automatización del postentrenamiento de LLM: Al especificar un modelo base (por ejemplo, Qwen3-1.7B), el agente busca artículos relevantes, explora y verifica datasets adecuados en Hub, ejecuta entrenamiento SFT o GRPO y evalúa con benchmarks como GPQA. Se ha informado de una mejora de Qwen3-1.7B en GPQA de aproximadamente 10 % a 32 % en una sesión de 10 horas con una H100, según PostTrainBench.

📄 Documentación oficial🐙 GitHub

📝 Notas de actualización

Aún no hay notas de actualización.

🧪 Código de la vida relacionado

Aún no hay publicaciones relacionadas de Código de la vida.