Ingeniería de arneses: control de agentes de IA
Al finalizar este tema
Comprenderá en qué se diferencia la ingeniería de arneses de la ingeniería de prompts y conocerá los conceptos clave para controlar de forma segura los agentes de IA.
La ingeniería de prompts por sí sola es insuficiente
La ingeniería de prompts es la "técnica de comunicarse eficazmente con la IA". Investiga cómo formular preguntas para obtener buenas respuestas. Por ejemplo, si le decimos a ChatGPT "responde como un experto", la calidad de la respuesta mejora.
Sin embargo, la situación cambia cuando la IA comienza a realizar acciones, más allá de simplemente mantener una conversación. Un agente es aquel que lee archivos, ejecuta código, llama a API y envía correos electrónicos.
¿Qué ocurre si le pedimos a un agente que "corrija este error" y este modifica archivos irrelevantes, accede a la base de datos de producción o realiza llamadas infinitas a una API costosa? Los prompts por sí solos no pueden prevenir estos incidentes.
Arnés = Cordón de seguridad
Un arnés es, originalmente, un cinturón de seguridad utilizado en escalada o trabajos en altura. Es un dispositivo que permite moverse con libertad, pero detiene el movimiento en direcciones peligrosas.
La ingeniería de arneses consiste en proporcionar este cordón de seguridad a los agentes de IA:
Limita las herramientas que puede usar. Permite leer archivos, pero prohíbe eliminarlos; solo permite llamar a API específicas. Esto se denomina permisos de herramientas.
Define el alcance de lo que puede hacer. Solo permite modificar archivos dentro de esta carpeta; solo permite confirmar cambios en esta rama; solo permite llamadas a API con un costo inferior a este límite. Esto se denomina ámbito.
Establece puntos que requieren aprobación humana. La modificación de código es libre, pero la implementación debe ser verificada por una persona. Esto se denomina "humano en el bucle".
Prompt vs. Arnés
Ingeniería de prompts:
"Nunca toques la base de datos de producción."
→ Si la IA "sigue las instrucciones bien" no lo toca
→ Si la IA "comete un error", podría tocarlo
Ingeniería de harness:
No se proporciona ni siquiera la información de conexión a la base de datos de producción
→ Es físicamente imposible que la IA lo intenteEl prompt es una petición, y el harness es una restricción. La IA puede ignorar el prompt, pero el harness se aplica a nivel del sistema.
Un buen sistema de agentes de IA utiliza ambos. El prompt establece la dirección, y el harness impone los límites.
Casos de aplicación reales
Editor de código con IA (Cursor, Claude Code, etc.) — Solicita la aprobación del usuario antes de modificar archivos. Advierte antes de ejecutar ciertos comandos (rm -rf, git push --force). Esto es el harness.
Bot de servicio al cliente — Puede procesar reembolsos, pero escala a un humano si el monto supera cierto límite. Puede consultar información del cliente, pero no modificarla.
Conducción autónoma — La IA controla la dirección y la aceleración, pero transfiere automáticamente el control a un humano en ciertas condiciones (fallos de sensores, clima extremo).
El patrón es el mismo: establecer a nivel del sistema los límites entre lo que se puede y lo que no se puede hacer.
Por qué es importante ahora
A partir de 2024-2025, ha habido un aumento explosivo en los agentes de IA. Se están desplegando en la práctica diaria agentes de IA que escriben código, resumen actas de reuniones, envían correos electrónicos y gestionan servidores.
Cuanto más potente es la IA, mayor es el impacto de sus errores. No basta con decir "ten cuidado" mediante un prompt. Se necesitan mecanismos de seguridad estructurales.
La ingeniería de harness no se trata de "qué tan bien se entrena a la IA", sino de "cómo construir sistemas que sean tolerantes a fallos cuando la IA comete errores".
Esencial
La ingeniería de harness es la técnica para limitar el rango de acción de los agentes de IA a nivel del sistema. Si el prompt es una "petición", el harness es una "restricción". Se necesitan ambos. En la era en que la IA utiliza herramientas y actúa realmente, lo esencial es crear estructuras que sean seguras incluso si ocurren errores.