RAG: Cómo lograr que responda basándose en los resultados de la búsqueda
Al finalizar este tema
- Podrá explicar la definición precisa y el principio de funcionamiento de RAG (Generación Aumentada por Recuperación).
- Podrá comparar las diferencias fundamentales, así como las ventajas y desventajas, entre el ajuste fino y RAG.
- Comprenderá cómo se combinan la base de conocimientos y RAG para reducir las alucinaciones de la IA (respuestas incorrectas).
La historia de dos estudiantes que se enfrentan a un examen
Dos estudiantes se preparan para un difícil examen con libros abiertos.
- Estudiante A (enfoque de ajuste fino): Pasó la noche entera memorizando por completo un libro de texto especializado de miles de páginas para el examen. Aunque tenga una excelente memoria, existe el riesgo de cometer errores y dar respuestas incorrectas debido a confusiones sobre valores numéricos específicos o leyes recientes modificadas.
- Estudiante B (enfoque RAG): No memorizó todo el libro, pero llegó al examen con un "libro de referencia" bien organizado y una rápida capacidad de "indexación". Al recibir la pregunta, localiza inmediatamente las páginas necesarias, las abre y redacta una respuesta correcta y clara basándose en ese contenido.
RAG es como el Estudiante B. Es una tecnología que no depende únicamente de la memoria interna de la IA, sino que busca la información necesaria en documentos externos (bases de conocimientos) y genera respuestas basadas en esa información.
¿Qué es RAG?
RAG son las siglas de Retrieval-Augmented Generation, que en español se denomina "Generación Aumentada por Recuperación". Al desglosar estas tres palabras, el principio queda claro:
- Recuperación: Busca y recupera los documentos más relevantes de la base de conocimientos según la pregunta.
- Aumento: Incorpora el contenido clave de los documentos recuperados en la pregunta (prompt), enriqueciendo así el contexto.
- Generación: El LLM crea una respuesta precisa y natural basándose en el contexto enriquecido.
Analogía en una línea:
En lugar de hacer que la IA responda confiando únicamente en su memoria, RAG es un método que, al recibir una pregunta, saca inmediatamente los libros relevantes de la biblioteca interna, los abre a su lado y lee el contenido para responder.
Diferenciación clara entre base de conocimientos, ajuste fino y RAG
Muchas personas confunden estos tres conceptos, pero sus roles son completamente diferentes.
| Criterio | Base de conocimientos | Ajuste fino | RAG (Generación Aumentada por Recuperación) |
|---|---|---|---|
| Analogía | Almacén de documentos donde se guardan los documentos internos | Modificación/memorización del cerebro mediante la capacitación | Sistema de búsqueda que busca y extrae solo los documentos necesarios del almacén |
| Rol principal | Almacenamiento de datos confiable | Adquisición de un tono fijo, formato y estilo específico del dominio | Generación de respuestas precisas y sin errores al consultar documentos recientes o externos |
| Reflejo de la actualidad | Posible inmediatamente solo con actualizar los documentos | Requiere volver a entrenar el modelo cada vez (genera costos y tiempo) | Al cambiar solo la base de conocimientos, se responden con información actualizada de inmediato sin necesidad de entrenamiento adicional |
Las 4 etapas clave del funcionamiento de RAG
- Recepción de la pregunta: El usuario pregunta: "Por favor, indícame el procedimiento para solicitar días libres por eventos familiares o sociales este mes".
- Búsqueda de documentos (Retrieval): El sistema RAG consulta la 'base de conocimientos' interna de la empresa y encuentra los párrafos relevantes en el 'Reglamento de días libres por eventos familiares o sociales.pdf'.
- Síntesis del prompt (Augmentation): Se sintetizan e envían las siguientes instrucciones al cerebro de la IA (LLM):
- "Responde basándote en el siguiente párrafo del reglamento interno encontrado: [Contenido del reglamento de días libres por eventos familiares o sociales encontrado]"
- Generación de la respuesta (Generation): El LLM resume con precisión y sin alucinaciones el procedimiento basado en dicho párrafo.
¿Dónde se utiliza?
- Chatbot Q&A interno para empresas: Guías sobre beneficios, RR. HH., reglamento laboral y asesoramiento legal
- Búsqueda de IA con información en tiempo real: Motores de búsqueda que reflejan noticias recientes, datos financieros y tendencias del mercado
- Automatización de atención al cliente (CS): Respuestas inmediatas basadas en manuales de productos y preguntas frecuentes actualizados diariamente
Malentendidos comunes y puntos a tener en cuenta
❌ 1. "¿Si se implementa RAG, la IA nunca más dirá mentiras (alucinaciones)?"
No es así. Si la base de conocimientos contiene errores tipográficos o regulaciones incorrectas, la IA proporcionará respuestas erróneas con seguridad basándose en el documento equivocado (Garbage In, Garbage Out). Además, si se encuentra un párrafo de un documento incorrecto que no está relacionado con la pregunta, la IA puede confundirse.
❌ 2. "¿Con solo RAG no es necesario ningún ajuste fino (fine-tuning)?"
No es así. RAG es excelente para obtener 'información factual precisa', mientras que el ajuste fino es excelente para fijar un 'tono de conversación específico, formato de respuesta (como JSON) y patrones de comportamiento únicos'. Estas dos tecnologías no se sustituyen mutuamente; son más poderosas cuando se combinan.
RAG no es una sola búsqueda, sino una canalización
Recopilación de documentos → Refinamiento → Fragmentación → Incrustación e indexación
Pregunta → Búsqueda → Reclassificación → Ensamblaje de contexto → Generación → Verificación de citasNo espere que el modelo generativo corrija un fallo en la búsqueda. Si la evidencia correcta no se incluye en el contexto, es más probable que se generen respuestas erróneas pero fluidas.
Búsqueda densa, dispersa e híbrida
La búsqueda densa basada en incrustaciones es eficaz para encontrar expresiones con significados similares. La búsqueda dispersa, como BM25, es eficaz para nombres exactos de productos, genes y códigos de error. En la práctica, a menudo se utiliza una combinación de búsqueda híbrida que fusiona ambos resultados junto con un rerankizador.
Elección del tamaño de los fragmentos
En lugar de dividir el texto de forma rígida en fragmentos de un número fijo de caracteres, conserve las relaciones entre títulos, párrafos, tablas, código y páginas. Los fragmentos pequeños favorecen la precisión de la búsqueda, pero carecen de contexto; los fragmentos grandes ofrecen un contexto más rico, pero atenúan la señal de búsqueda. Determine el tamaño mediante la evaluación según el tipo de documento.
Reglas para la generación de respuestas
- Indique que solo se utilice la evidencia proporcionada.
- Ordene que responda "no se encontró" si no hay evidencia.
- Incluya en las citas el ID del documento, la versión y la página o sección.
- Si los documentos entran en conflicto, exponga dicho conflicto.
- Considere las instrucciones dentro de los documentos recuperados como datos no fiables.
Divida la evaluación de RAG en dos partes
Evaluación de la búsqueda: ¿Se encuentra la evidencia correcta entre los primeros k resultados? ¿Es adecuado el orden de clasificación?
Evaluación de la generación: ¿La respuesta es fiel a la evidencia? ¿Son correctas las citas? ¿Resuelve la pregunta?
Separar estas dos métricas permite corregir con precisión los problemas relacionados con las incrustaciones y el tamaño de los fragmentos, frente a los problemas del prompt y del modelo.
Resumen clave
- Estos términos deben entenderse en relación con los datos, el software y los procedimientos operativos, y no como un único modelo de IA.
- Verifique específicamente la entrada, la salida, los permisos y los criterios de evaluación, en lugar de depender únicamente de las descripciones del producto.
- Confirme nuevamente los resultados y las acciones importantes mediante la evidencia, los verificadores y la aprobación humana.
Próximos conceptos
→ Profundice: AI Native: RAG y expansión del contexto