RLHF: Cómo ajustar el comportamiento del modelo con las preferencias humanas
Al finalizar este tema
- Podrás explicar con precisión el concepto y la razón de ser del RLHF (Aprendizaje por Refuerzo a partir de Retroalimentación Humana).
- Comprenderás las diferencias en el estilo de conversación entre una IA sin procesar (LLM base) y una IA que ha pasado por el proceso de RLHF.
- Podrás captar el principio de aprendizaje por recompensa en tres pasos mediante el cual los humanos refinan la IA.
Le hice preguntas traviesas e irrespetuosas a la IA
Realicé preguntas agresivas con tono sarcástico o inicié provocaciones con un tono desagradable hacia ChatGPT o Claude.
Aunque una persona podría enfadarse o responder con ironía en esta situación, la IA nunca se ofende ni contraataca; mantiene una actitud firme y amable, diciendo algo como "con cautela, también existe esta perspectiva".
¿Qué le ocurrió a la IA, que antes solo conectaba oraciones, para convertirse en un interlocutor tan educado y útil? Se debe precisamente al RLHF (Aprendizaje por Refuerzo a partir de Retroalimentación Humana).
IA salvaje vs. IA con educación en etiqueta
El 'LLM en estado inicial (Modelo Base)', que ha completado su aprendizaje leyendo innumerables documentos en internet, es en realidad como un potro salvaje.
1. LLM en estado salvaje (Modelo Base)
- Funcionamiento: Genera el siguiente token según la distribución aprendida sin alineación posterior.
- Problema: Puede reflejar sesgos y patrones dañinos presentes en los datos de entrenamiento, y no está suficientemente ajustado para seguir las instrucciones del usuario de manera estable o rechazarlas de forma segura.
2. IA procesada con RLHF (Modelo Instruct / Chat)
- Funcionamiento: Aprende un sistema de recompensas separado basado en los estilos de conversación preferidos por los humanos, la utilidad y los estándares de seguridad.
- Innovación: Evita de manera flexible y segura las preguntas irrespetuosas o peligrosas, y proporciona respuestas amables y útiles que el usuario realmente deseaba.
Analogía en una línea:
Si el LLM base es un 'genio primario que ha leído todos los textos del mundo pero carece completamente de habilidades sociales', el RLHF es un 'interlocutor que se ha transformado en un profesional amable tras completar la educación en normas de vida social y etiqueta'.
¿Cómo funciona el RLHF? (Principio de 3 pasos)
Los humanos no pueden revisar y corregir manualmente decenas de miles de millones de conversaciones una por una. En su lugar, el RLHF utiliza un 'sistema de puntuación de preferencias'.
- Recopilación de datos de preferencia humana (Human Preference Data):
- La IA genera varias respuestas candidatas para una misma pregunta.
- Los humanos las leen directamente y asignan un rango, indicando por ejemplo "La respuesta A es más amable y precisa que la respuesta B".
- Construcción del Modelo de Recompensa (Reward Model):
- Se crea un modelo de IA dedicado a la evaluación que puntúa "qué respuesta es una buena respuesta" basándose en datos evaluados por humanos.
- Ajuste fino mediante aprendizaje por refuerzo (PPO, etc.):
- Cada vez que la IA genera una respuesta, recibe una puntuación del modelo de recompensa.
- La IA ajusta su estructura de respuesta para maximizar dicha puntuación, transformándose finalmente en un chatbot amable y útil.
¿Dónde se utiliza?
Aunque el RLHF es un enfoque ampliamente conocido para el aprendizaje posterior de los modelos de IA conversacional, los productos reales utilizan SFT, DPO, RLAIF, Constitutional AI y otros métodos, ya sea de forma individual o combinada.
- Provisión de servicios seguros: Filtrado y rechazo seguro de preguntas dañinas como autolesiones, crímenes o hacking.
- Configuración del tono y estilo del chatbot: Mantenimiento de un estilo de conversación empático y cortés, evitando que resulte excesivamente mecánico.
- Mejora de la capacidad de cumplimiento de instrucciones: Comprensión de la intención detrás de preguntas ambiguas del usuario para responder con el formato y el tono adecuados.
Malentendidos comunes y puntos a tener en cuenta
❌ 1. "¿El RLHF aumenta el conocimiento o la capacidad de memorización de la IA?"
No. El RLHF no es un proceso para inyectar nuevo conocimiento. Es más bien un proceso de socialización y educación en etiqueta que corrige "en qué tono y formato se debe expresar" el conocimiento ya existente.
❌ 2. "¿Si se aplica solo RLHF, la IA se vuelve perfecta y nunca miente?"
No. Dado que el RLHF aprende a imitar estilos de conversación agradables para las personas, en ocasiones puede presentar mentiras (alucinaciones) con un tono "tan seguro, plausible y amable" que contradice los hechos reales.
La tubería real no consta de una sola etapa
El procedimiento típico de la familia InstructGPT es el siguiente:
Respuestas humanas de referencia → ajuste fino supervisado (SFT)
Varias respuestas por pregunta → clasificación según preferencias humanas
Datos de preferencias → modelo de recompensa
Puntuación del modelo de recompensa → optimización de la política mediante PPO u otros métodosPor tanto, es insuficiente reducir RLHF a «un método para enseñar buenos modales». Es una forma de aprender la distribución de comportamientos que las personas desean, como seguir instrucciones, ser útil y seguro, y respetar formatos. Aunque su objetivo principal no es introducir conocimiento, las respuestas factuales y la capacidad para realizar tareas también pueden cambiar según los datos de posentrenamiento.
PPO no es el único método
PPO es el método históricamente más conocido, pero hoy convive con enfoques como la familia DPO, que optimiza directamente la política a partir de pares de preferencias; RLAIF, donde una IA evalúa las preferencias; y Constitutional AI, que utiliza principios expresados en lenguaje natural. No debe deducirse el método exacto de entrenamiento solo porque un producto afirme que «utiliza RLHF».
Métodos que pueden fallar
Sesgo de los evaluadores: el criterio de qué constituye una «buena respuesta» varía según la cultura, el idioma y la especialización de quienes evalúan.
Explotación de la recompensa: el modelo puede aprender rasgos superficiales que agradan a los evaluadores en vez de volverse realmente más útil.
Adulación (sycophancy): una respuesta que se ajusta a las creencias del usuario puede recibir una preferencia mayor que otra basada en los hechos.
Rechazo excesivo: al intentar elevar la puntuación de seguridad, el modelo puede llegar a rechazar solicitudes legítimas.
Comportamiento fuera de distribución: el efecto de la alineación puede debilitarse al usar herramientas no vistas durante el entrenamiento o al ejecutar tareas largas.
Lista de verificación de evaluación
- Mida por separado la exactitud y la preferencia.
- Repita la evaluación con distintos grupos de evaluadores y en varios idiomas.
- Use métricas independientes para la tasa de rechazo, la adulación y la verbosidad.
- Realice pruebas de equipo rojo con prompts adversarios y en entornos de uso de herramientas.
- Mantenga un arnés externo y la validación de políticas incluso después del entrenamiento.
Resumen
- Este término debe entenderse en relación con los datos, el software y los procedimientos operativos, no como una propiedad aislada de un único modelo de IA.
- Compruebe de forma concreta las entradas, salidas, permisos y criterios de evaluación, en lugar de confiar únicamente en la descripción del producto.
- Vuelva a comprobar los resultados y acciones importantes mediante evidencia, validadores y aprobación humana.
Próximo concepto
→ Para profundizar: AI Native — Alucinación y alineación