Fine-tuning — Cómo adaptar un modelo a una tarea específica
Al finalizar este tema
- Comprenderá el concepto preciso y la necesidad del ajuste fino (fine-tuning).
- Podrá explicar las diferencias entre un LLM genérico y un modelo de IA ajustado.
- Contará con criterios claros para determinar en qué situaciones debe implementarse el ajuste fino.
Invitamos a la IA a una reunión de nuestra empresa
Invitamos a ChatGPT, famoso por su inteligencia, a asistir a una reunión de nuestra empresa.
"Analiza el nivel de cumplimiento de los OKR del proyecto Pathfinder del Q3".
Sin embargo, la IA se queda perpleja y titubea. No sabe a qué trimestre corresponde el "Q3", qué es el "proyecto Pathfinder" ni qué elementos y fórmulas utiliza nuestra empresa para redactar los OKR.
A pesar de que la IA ha memorizado todo tipo de conocimientos del mundo, ante "los asuntos internos de nuestra empresa o la terminología especializada de un campo específico" no pasa de ser un principiante. El proceso de ajustar los pesos del modelo mediante ejemplos de tareas que esta IA debe realizar repetidamente y el patrón de respuesta deseado es lo que se denomina ajuste fino (Fine-Tuning).
IA genérica vs. IA ajustada
1. IA genérica (Base / Chat LLM)
- Estado: Un recién graduado de una universidad prestigiosa; un empleado nuevo y versátil que lo sabe todo sobre el mundo.
- Características: Es bueno con el conocimiento general, la traducción y la redacción, pero no conoce los secretos comerciales de una empresa específica, los formatos especializados de medicina o derecho, ni las reglas de los sistemas internos.
2. IA ajustada (Fine-Tuned Model)
- Estado: Un "especialista" que ha estudiado exhaustivamente los documentos internos, actas de reuniones y manuales de trabajo de nuestra empresa de los últimos cinco años.
- Características: Al recibir una pregunta, ofrece respuestas personalizadas al instante utilizando la terminología propia de nuestra empresa, formatos específicos y el tono y estilo (tone and manner) establecidos.
Analogía en una frase:
Si la IA genérica es un "empleado nuevo erudito pero que desconoce los asuntos de nuestra empresa", el ajuste fino es un "responsable familiarizado con métodos de trabajo específicos tras haber pasado por la formación interna y el entrenamiento laboral".
¿Cómo se realiza el ajuste fino?
Reconstruir desde cero el cerebro (los pesos del modelo) de una IA ya masivamente desarrollada costaría decenas de miles de millones. El ajuste fino es un método rentable que mantiene intacto el cerebro existente y solo ajusta ligeramente algunos de sus pesos (Fine-Tune).
- Preparación del conjunto de datos especializado:
- Se preparan ejemplos de alta calidad en formato "entrada - salida deseada". La cantidad necesaria varía desde decenas hasta más de decenas de miles de casos, dependiendo de la tarea, el modelo y el método de aprendizaje.
- Ejemplo: (Pregunta) "¿Es aplicable la disposición excepcional del artículo 3 de los términos y condiciones?" → (Respuesta deseada) "Este caso se rige por la disposición excepcional del inciso B..."
- Entrenamiento adicional (Re-training):
- Se inyecta el conjunto de datos recopilado en un LLM existente para actualizar ligeramente sus pesos.
- Creación de modelos especializados:
- Se crea una IA personalizada capaz de ejecutar instrucciones de un campo específico con precisión y en un formato consistente, sin necesidad de explicaciones extensas.
¿Dónde se utiliza?
- IA para dominios especializados (medicina/derecho/finanzas): Áreas que requieren el manejo preciso de terminología compleja, jurisprudencia y diagnósticos en formatos específicos.
- Chatbots internos personalizados para empresas: Chatbots que dominan perfectamente las normativas internas, los manuales de atención al cliente (CS) y los procesos operativos propios de la empresa.
- Fijación de tono y estilo: Sistemas automatizados que deben responder siguiendo un personaje específico, el estilo propio de una marca o exclusivamente en formatos de datos JSON/XML fijos.
Malentendidos frecuentes y puntos a tener en cuenta
❌ 1. "¿Se utiliza el fine-tuning para enseñar noticias actualizadas diariamente o información en tiempo real?"
No. El fine-tuning es un proceso que modifica el "propio cerebro" del modelo, por lo que requiere tiempo y costes. Para enseñar información que cambia a diario o regulaciones que se modifican con frecuencia, es mucho más eficiente conectar una RAG (Generación Aumentada por Recuperación) o una base de conocimientos, conceptos que se aprenderán más adelante.
❌ 2. "¿El fine-tuning aumenta drásticamente la inteligencia general de la IA?"
No. Al ser un proceso de entrenamiento intensivo en un área específica, si se entrena en exceso puede ocurrir el fenómeno de sobreajuste (overfitting), donde las capacidades de razonamiento general o de respuestas de sentido común que antes funcionaban bien pueden disminuir.
¿Qué tecnología se utiliza para aprender?
El fine-tuning no es un "botón para memorizar" documentos completos. Es adecuado cuando es necesario cambiar de forma continua el comportamiento del modelo, como en patrones de tareas repetitivas, formatos de salida, criterios de clasificación o expresiones propias de un dominio.
| Requisito | Prioridad de revisión |
|---|---|
| Respuestas sobre regulaciones/documentos recientes | RAG |
| Formatos JSON fijos · sistemas de clasificación | Fine-tuning |
| Especificación de un método de trabajo puntual | Prompt |
| Repetición de terminología especializada y estilo | Fine-tuning + evaluación |
| Hechos en tiempo real desconocidos para el modelo | Búsqueda · herramientas |
Ajuste completo y PEFT
El ajuste completo (full fine-tuning), que actualiza todos los pesos, conlleva altos costes y requiere gran capacidad de almacenamiento. El PEFT (Parameter-Efficient Fine-Tuning) como LoRA reduce los costes entrenando solo pequeños adaptadores de bajo rango. También es ampliamente utilizado QLoRA, que entrena adaptadores sobre modelos cuantizados.
Pesos del modelo base: fijos
+
Adaptador LoRA pequeño: entrenamiento
=
Comportamiento ajustado a una tarea específicaCuando la calidad de los datos es más importante que el tamaño del modelo
- Si una sola entrada tiene múltiples formatos de respuesta correctos, el modelo se vuelve inestable.
- Es difícil eliminar las respuestas incorrectas y la información personal después del entrenamiento.
- Si se mezclan documentos similares en los conjuntos de entrenamiento, validación y prueba, las puntuaciones se inflan artificialmente.
- Recopilar únicamente "ejemplos perfectos" que difieren de las preguntas reales de producción no garantiza un buen rendimiento en la práctica.
- Los datos deben incluir tanto las entradas que deben rechazarse como las respuestas para los casos en los que no se sabe la respuesta.
Evaluación previa al despliegue
Se comparan el modelo base y el modelo ajustado utilizando el mismo conjunto de evaluación fijo. Se mide no solo la precisión, sino también la tasa de cumplimiento de formato, la tasa de alucinaciones, la tasa de rechazo, la latencia, el costo y la degradación de las capacidades generales. Si el nuevo modelo mejora únicamente una métrica específica, pero pierde otras capacidades importantes, no se adopta.
Resumen clave
- Este concepto debe entenderse en relación con los datos, el software y los procedimientos operativos, y no como un modelo de IA aislado.
- Verifique específicamente las entradas, salidas, permisos y criterios de evaluación, más allá de la descripción del producto.
- Los resultados y acciones importantes deben confirmarse mediante evidencia, verificadores y aprobación humana.
Conceptos siguientes
→ Profundizar: AI Native — Cómo aprenden las redes neuronales