Volver a la lista

Base de conocimientos: cómo crear la capa de información en la que la IA confía y de la que obtiene información.

Se explica el proceso de recopilación, limpieza, gestión de metadatos, control de permisos y versiones de los documentos de una base de conocimiento para IA, así como los preparativos necesarios antes de conectarla con un sistema RAG.

Principiante
|
10min
|
Verificado (2026-07)
Progreso0/48 (0%)

Base de conocimientos: cómo crear la capa de información en la que la IA confía y a la que recurre

Al finalizar este tema

  • Podrá explicar con precisión la definición de una base de conocimientos y la necesidad de crearla.
  • Podrá distinguir claramente entre la "inteligencia" del propio modelo de IA y el "almacén de conocimientos".
  • Comprenderá por qué la base de conocimientos desempeña un papel fundamental para reducir las alucinaciones.

Le pregunté a la IA sobre las normas internas actualizadas

"Por favor, indíqueme el procedimiento actualizado para solicitar vacaciones y los criterios de pago de gastos por enfermedad o fallecimiento que se aplican en nuestra empresa a partir de este mes".

Si le hace esta pregunta a ChatGPT, responderá con información falsa (alucinación) utilizando un tono muy convincente y seguro de sí mismo.

La razón por la que las primeras versiones de ChatGPT generaron controversia debido a sus descaradas mentiras radica precisamente en esto. Por muy inteligente que sea una IA, no tiene en su base (LLM) información como "las normas más recientes de nuestra empresa, los manuales de trabajo o las actas de reuniones", ya que nunca se han hecho públicas.

Para resolver este problema, existe un lugar donde la IA puede consultar documentos verificados antes de comenzar a trabajar; esto es lo que se conoce como base de conocimientos.

¿Qué es una base de conocimientos?

Una base de conocimientos es un "almacén de datos y documentos" que recopila y gestiona de manera sistemática en un solo lugar documentos depurados, reglamentos, manuales, preguntas frecuentes (FAQ) y actas de reuniones utilizados por una organización o campo específico.

Concepto clave: Inteligencia de la IA vs. Base de conocimientos

  • Modelo de IA (LLM): Un empleado inteligente que se ha graduado de la academia de formación (posee capacidades de razonamiento y redacción).
  • Base de conocimientos (KB): El reglamento oficial de trabajo y los manuales organizados en la biblioteca interna de la empresa.

Analogía en una línea:

La base de conocimientos no aumenta la "inteligencia" de la IA, sino que actúa como un "almacén de documentos seguros" organizado para que la IA pueda consultarlo en cualquier momento cuando lo necesite.

¿Por qué es necesaria la base de conocimientos?

  1. Prevención de las alucinaciones:
    • Evita que la IA invente información basándose únicamente en su memoria.
  2. Mantenimiento de la actualidad:
    • Permite reflejar información actualizada simplemente actualizando los documentos de la base de conocimientos, sin necesidad de volver a entrenar todo el modelo de IA con costos millonarios.
  3. Garantía de seguridad interna y precisión:
    • Hace que se refiera únicamente a una "fuente única de verdad" verificada directamente por nuestra empresa, en lugar de información de origen incierto en Internet.

¿Dónde se utiliza?

  • Atención al cliente / Soporte interno de la empresa: Atención al cliente basada en datos de manuales de productos y preguntas frecuentes (FAQ).
  • Servicio de información sobre normas internas / Recursos Humanos: Respuestas a preguntas administrativas internas como días de vacaciones, beneficios y reglamento laboral.
  • Desarrollo e ingeniería: Sistema de asistencia para desarrolladores que recopila documentos de API interna y guías de estilo de código.

Conceptos erróneos comunes y puntos a tener en cuenta

❌ 1. "¿Si creo una base de conocimientos, la IA se volverá más inteligente por sí sola y responderá mejor?"

No. Una base de conocimientos es simplemente un "almacén de documentos". Aunque se haya creado el almacén, si no existe un mecanismo (que se aprenderá en el siguiente paso: RAG) que permita a la IA acceder al almacén y extraer los documentos correctos cuando recibe una pregunta, la IA no podrá utilizar la base de conocimientos.

❌ 2. "¿Puedo recopilar y agregar textos de Internet sin ningún criterio?"

No. Se aplica directamente el principio de "basura entra, basura sale". Si en la base de conocimientos se mezclan errores tipográficos, información contradictoria o documentos obsoletos, la IA proporcionará respuestas basadas en fundamentos incorrectos; por lo tanto, es imprescindible un proceso de depuración.

No es lo mismo que una carpeta con archivos

Una base de conocimientos operativa requiere, además del texto original, información sobre el estado:

CampoRazón
ID y versión del documentoDistinguir entre las versiones nueva y antigua de la misma normativa
PropietarioConfirmar quién es responsable de la exactitud
Fecha de validez y fecha de caducidadExcluir información obsoleta de las búsquedas
Nivel de accesoBloquear documentos que los usuarios no pueden ver
Origen y estado de aprobaciónDiferenciar entre documentos oficiales y notas de referencia
Idioma y tipo de documentoDeterminar la estrategia de búsqueda y segmentación

Ciclo de vida desde la recopilación hasta la eliminación

text
colección → deduplicación → refinamiento → aprobación → indexación → uso → actualización → desecho

Es tan importante excluir documentos antiguos de los resultados de búsqueda como añadir documentos nuevos. Si se buscan simultáneamente normativas nuevas y obsoletas, el modelo de lenguaje grande (LLM) podría combinar ambas en la respuesta.

Los permisos se aplican antes de la búsqueda

No es suficiente indicarle al LLM “no reveles información confidencial” después de la búsqueda. Primero, se deben filtrar los resultados de búsqueda según los permisos del usuario. Aplique las mismas políticas de acceso a la base de datos vectorial, el repositorio de documentos originales, la caché y los registros.

Indicadores de calidad

  • Proporción de documentos actualizados y tasa de exposición de documentos obsoletos
  • Número de documentos duplicados o contradictorios
  • Recuperación (recall) de documentos correctos por pregunta, es decir, la proporción de veces que el documento correcto se encuentra entre los k primeros resultados
  • Proporción de citas en las respuestas que coinciden con la ubicación del documento original
  • Cumplimiento del ciclo de revisión por parte del propietario del documento

La base de conocimientos no es un proyecto que se construye una sola vez, sino un producto que se gestiona continuamente.

Resumen clave

  • Este concepto debe entenderse en relación con los datos, el software y los procedimientos operativos, y no como un único modelo de IA.
  • Verifique específicamente las entradas, salidas, permisos y criterios de evaluación, en lugar de limitarse a la descripción del producto.
  • Confirme nuevamente los resultados y acciones importantes con sus fundamentos, mecanismos de verificación y aprobación humana.

Próximos conceptos

→ Profundizar: AI Native largo — RAG y expansión de contexto

💬 Preguntas y comentarios

0 comentarios

Puedes publicar sin iniciar sesión. Los comentarios de invitados no pueden editarse ni eliminarse después.

0/2000

Cargando...