Volver a la lista

RAG: Cómo generar respuestas basadas en los resultados de búsqueda.

Explica la recopilación, la división en fragmentos (chunking), la creación de incrustaciones (embedding), la búsqueda híbrida, el reordenamiento (reranking), el ensamblaje del contexto, la verificación de citas y las causas de error en RAG.

Intermedio
|
12min
|
Verificado (2026-07)
Progreso0/48 (0%)

RAG: Cómo lograr que responda basándose en los resultados de la búsqueda

Al finalizar este tema

  • Podrá explicar la definición precisa y el principio de funcionamiento de RAG (Generación Aumentada por Recuperación).
  • Podrá comparar las diferencias fundamentales, así como las ventajas y desventajas, entre el ajuste fino y RAG.
  • Comprenderá cómo se combinan la base de conocimientos y RAG para reducir las alucinaciones de la IA (respuestas incorrectas).

La historia de dos estudiantes que se enfrentan a un examen

Dos estudiantes se preparan para un difícil examen con libros abiertos.

  • Estudiante A (enfoque de ajuste fino): Pasó la noche entera memorizando por completo un libro de texto especializado de miles de páginas para el examen. Aunque tenga una excelente memoria, existe el riesgo de cometer errores y dar respuestas incorrectas debido a confusiones sobre valores numéricos específicos o leyes recientes modificadas.
  • Estudiante B (enfoque RAG): No memorizó todo el libro, pero llegó al examen con un "libro de referencia" bien organizado y una rápida capacidad de "indexación". Al recibir la pregunta, localiza inmediatamente las páginas necesarias, las abre y redacta una respuesta correcta y clara basándose en ese contenido.

RAG es como el Estudiante B. Es una tecnología que no depende únicamente de la memoria interna de la IA, sino que busca la información necesaria en documentos externos (bases de conocimientos) y genera respuestas basadas en esa información.

¿Qué es RAG?

RAG son las siglas de Retrieval-Augmented Generation, que en español se denomina "Generación Aumentada por Recuperación". Al desglosar estas tres palabras, el principio queda claro:

  1. Recuperación: Busca y recupera los documentos más relevantes de la base de conocimientos según la pregunta.
  2. Aumento: Incorpora el contenido clave de los documentos recuperados en la pregunta (prompt), enriqueciendo así el contexto.
  3. Generación: El LLM crea una respuesta precisa y natural basándose en el contexto enriquecido.

Analogía en una línea:

En lugar de hacer que la IA responda confiando únicamente en su memoria, RAG es un método que, al recibir una pregunta, saca inmediatamente los libros relevantes de la biblioteca interna, los abre a su lado y lee el contenido para responder.

Diferenciación clara entre base de conocimientos, ajuste fino y RAG

Muchas personas confunden estos tres conceptos, pero sus roles son completamente diferentes.

CriterioBase de conocimientosAjuste finoRAG (Generación Aumentada por Recuperación)
AnalogíaAlmacén de documentos donde se guardan los documentos internosModificación/memorización del cerebro mediante la capacitaciónSistema de búsqueda que busca y extrae solo los documentos necesarios del almacén
Rol principalAlmacenamiento de datos confiableAdquisición de un tono fijo, formato y estilo específico del dominioGeneración de respuestas precisas y sin errores al consultar documentos recientes o externos
Reflejo de la actualidadPosible inmediatamente solo con actualizar los documentosRequiere volver a entrenar el modelo cada vez (genera costos y tiempo)Al cambiar solo la base de conocimientos, se responden con información actualizada de inmediato sin necesidad de entrenamiento adicional

Las 4 etapas clave del funcionamiento de RAG

  1. Recepción de la pregunta: El usuario pregunta: "Por favor, indícame el procedimiento para solicitar días libres por eventos familiares o sociales este mes".
  2. Búsqueda de documentos (Retrieval): El sistema RAG consulta la 'base de conocimientos' interna de la empresa y encuentra los párrafos relevantes en el 'Reglamento de días libres por eventos familiares o sociales.pdf'.
  3. Síntesis del prompt (Augmentation): Se sintetizan e envían las siguientes instrucciones al cerebro de la IA (LLM):
    • "Responde basándote en el siguiente párrafo del reglamento interno encontrado: [Contenido del reglamento de días libres por eventos familiares o sociales encontrado]"
  4. Generación de la respuesta (Generation): El LLM resume con precisión y sin alucinaciones el procedimiento basado en dicho párrafo.

¿Dónde se utiliza?

  • Chatbot Q&A interno para empresas: Guías sobre beneficios, RR. HH., reglamento laboral y asesoramiento legal
  • Búsqueda de IA con información en tiempo real: Motores de búsqueda que reflejan noticias recientes, datos financieros y tendencias del mercado
  • Automatización de atención al cliente (CS): Respuestas inmediatas basadas en manuales de productos y preguntas frecuentes actualizados diariamente

Malentendidos comunes y puntos a tener en cuenta

❌ 1. "¿Si se implementa RAG, la IA nunca más dirá mentiras (alucinaciones)?"

No es así. Si la base de conocimientos contiene errores tipográficos o regulaciones incorrectas, la IA proporcionará respuestas erróneas con seguridad basándose en el documento equivocado (Garbage In, Garbage Out). Además, si se encuentra un párrafo de un documento incorrecto que no está relacionado con la pregunta, la IA puede confundirse.

❌ 2. "¿Con solo RAG no es necesario ningún ajuste fino (fine-tuning)?"

No es así. RAG es excelente para obtener 'información factual precisa', mientras que el ajuste fino es excelente para fijar un 'tono de conversación específico, formato de respuesta (como JSON) y patrones de comportamiento únicos'. Estas dos tecnologías no se sustituyen mutuamente; son más poderosas cuando se combinan.

RAG no es una sola búsqueda, sino una canalización

text
Recopilación de documentos → Refinamiento → Fragmentación → Incrustación e indexación
Pregunta → Búsqueda → Reclassificación → Ensamblaje de contexto → Generación → Verificación de citas

No espere que el modelo generativo corrija un fallo en la búsqueda. Si la evidencia correcta no se incluye en el contexto, es más probable que se generen respuestas erróneas pero fluidas.

Búsqueda densa, dispersa e híbrida

La búsqueda densa basada en incrustaciones es eficaz para encontrar expresiones con significados similares. La búsqueda dispersa, como BM25, es eficaz para nombres exactos de productos, genes y códigos de error. En la práctica, a menudo se utiliza una combinación de búsqueda híbrida que fusiona ambos resultados junto con un rerankizador.

Elección del tamaño de los fragmentos

En lugar de dividir el texto de forma rígida en fragmentos de un número fijo de caracteres, conserve las relaciones entre títulos, párrafos, tablas, código y páginas. Los fragmentos pequeños favorecen la precisión de la búsqueda, pero carecen de contexto; los fragmentos grandes ofrecen un contexto más rico, pero atenúan la señal de búsqueda. Determine el tamaño mediante la evaluación según el tipo de documento.

Reglas para la generación de respuestas

  • Indique que solo se utilice la evidencia proporcionada.
  • Ordene que responda "no se encontró" si no hay evidencia.
  • Incluya en las citas el ID del documento, la versión y la página o sección.
  • Si los documentos entran en conflicto, exponga dicho conflicto.
  • Considere las instrucciones dentro de los documentos recuperados como datos no fiables.

Divida la evaluación de RAG en dos partes

Evaluación de la búsqueda: ¿Se encuentra la evidencia correcta entre los primeros k resultados? ¿Es adecuado el orden de clasificación?

Evaluación de la generación: ¿La respuesta es fiel a la evidencia? ¿Son correctas las citas? ¿Resuelve la pregunta?

Separar estas dos métricas permite corregir con precisión los problemas relacionados con las incrustaciones y el tamaño de los fragmentos, frente a los problemas del prompt y del modelo.

Resumen clave

  • Estos términos deben entenderse en relación con los datos, el software y los procedimientos operativos, y no como un único modelo de IA.
  • Verifique específicamente la entrada, la salida, los permisos y los criterios de evaluación, en lugar de depender únicamente de las descripciones del producto.
  • Confirme nuevamente los resultados y las acciones importantes mediante la evidencia, los verificadores y la aprobación humana.

Próximos conceptos

→ Profundice: AI Native: RAG y expansión del contexto

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...