Blog / Sistemas de IA

RAG que responde con tus datos, no alrededor de ellos

La mayoría de las fallas de RAG son fallas de datos que la recuperación deja al descubierto. Lo que tiene que estar resuelto antes de recuperar, desde las fuentes de verdad y los permisos hasta las citas y la búsqueda híbrida, para que tu asistente responda desde tu base de conocimiento.

La generación aumentada por recuperación, o RAG (retrieval-augmented generation), promete un asistente que responde desde tus propios documentos y no desde lo que el modelo aprendió en su entrenamiento. La demo es fácil: cargas unos archivos en una base de datos vectorial, haces una pregunta y obtienes una respuesta fluida. El problema empieza cuando la respuesta es fluida pero equivocada, o correcta pero sacada de un documento que ese usuario nunca debió ver.

Si lideras el equipo: qué preguntar

  • Para cada tipo de información, ¿cuál es el documento oficial del que responde el asistente?
  • ¿El asistente le puede mostrar a alguien un documento que esa persona no podría abrir por su cuenta?
  • ¿Cada respuesta muestra sus fuentes, y dice “no lo sé” cuando no las hay?

La mayoría de esas fallas no son fallas de recuperación. Son fallas de datos que la recuperación deja al descubierto. Lo que está resuelto antes de recuperar decide si un sistema RAG responde con tus datos o alrededor de ellos.

Nuestra parte, dicha con precisión

En una plataforma de IA para profesionales legales y de salud, estuvimos a cargo de la capa de integraciones y datos: ingesta desde muchos sistemas, normalización hacia un solo modelo validado, confiabilidad y trazabilidad, con datos regulados manejados según las expectativas de HIPAA, SOC 2 y GDPR. El equipo de la plataforma se encargaba de la búsqueda, la recuperación y los agentes. Trabajar debajo de ellos nos mostró cuánto de la calidad de la recuperación se decide antes.

1. Define tus fuentes de verdad y su frescura

Si la misma política existe como PDF, como página de wiki y como un correo viejo, ¿cuál cita el asistente? Decide, para cada tipo de información, qué sistema es la fuente de verdad, e indexa ese. Luego decide qué tan fresco tiene que estar: una lista de precios que cambia todos los días necesita una sincronización distinta a la de un manual que cambia una vez al año. Guarda la fecha de última actualización en cada registro para que una respuesta pueda decir qué tan vigente es.

2. Normaliza, con identificadores estables

Una base de conocimiento alimentada desde varios sistemas va a tener al mismo cliente, caso o producto con identificadores y nombres distintos. Normalízalos en un solo modelo con identificadores estables antes de indexar. Si no, la recuperación devuelve tres medias respuestas sobre lo que cree que son tres cosas distintas, y el modelo las cose en un solo error dicho con total seguridad.

3. Haz chunking con metadatos, no solo por tamaño

El chunking divide los documentos en pedazos lo bastante pequeños para recuperarlos. Cortar a un largo fijo parte las tablas a la mitad y separa un título del párrafo que lo explica. Sigue la estructura del propio documento: secciones, cláusulas, notas. Después agrega metadatos a cada chunk: sistema de origen, ID del documento, título, sección, fecha y reglas de acceso. Los embeddings encuentran texto que suena parecido; los metadatos son los que te permiten filtrarlo, citarlo y protegerlo.

4. Aplica permisos por documento y por usuario

Un asistente nunca debe recuperar lo que la persona que pregunta no podría abrir por sí misma. Lleva los permisos de cada documento al índice y filtra con ellos al momento de la consulta, para ese usuario, antes de que algo llegue al modelo. Filtrar después de generar es demasiado tarde: el modelo ya lo leyó. Con datos regulados, esto no es una función extra. Es el requisito.

5. Usa búsqueda híbrida

La búsqueda vectorial sobre embeddings es buena con el significado: relaciona “cancelar mi plan” con “terminar la suscripción”. Es débil con lo exacto: números de caso, códigos de producto, nombres, términos poco comunes. La búsqueda por palabras clave es lo contrario. La búsqueda híbrida corre las dos y combina los resultados, así una pregunta sobre un número de referencia concreto encuentra ese registro, y una pregunta formulada de manera vaga igual encuentra la sección correcta.

6. Cita cada respuesta

Cada afirmación de una respuesta debería apuntar al chunk del que salió, con un enlace al documento de origen. Las citas le permiten a un usuario verificar una respuesta en segundos, y te permiten probar automáticamente si la respuesta está respaldada por lo que se recuperó. Una respuesta sin fuente es una opinión.

7. Responde desde las fuentes, o di que no sabes

Indícale al modelo que responda solo desde los pasajes recuperados, y que lo diga claramente cuando no contengan la respuesta. Luego hazlo cumplir en el código: si el contexto recuperado está vacío o es débil, devuelve “No encontré esto en tus documentos” en lugar de dejar que el modelo llene el hueco de memoria. Un “no sé” claro genera más confianza que una suposición creíble.

Antes de indexar cualquier cosa

  • Una fuente de verdad definida para cada tipo de información
  • Una meta de frescura, y una fecha de última actualización en cada registro
  • Un solo modelo normalizado con identificadores estables
  • Chunks que respetan la estructura, con metadatos de origen, fecha y acceso
  • Filtro de permisos por usuario, al momento de la consulta
  • Búsqueda híbrida por palabras clave y vectorial
  • Citas en cada respuesta
  • Un camino de “no sé” probado

Si quieres un asistente que responda con tus propios datos, empieza con el chequeo de preparación para IA, o mira cómo trabajamos la IA con tus datos.

Este artículo se basa en un proyecto real. Datos del cliente reservados; cada cifra proviene de los datos del propio cliente.

Leer el caso de estudio completo →

¿Quieres que revisemos
tu sitio?

Cuéntanos dónde el tráfico, los ingresos o tus cifras dejaron de tener sentido. Te diremos qué revisaríamos primero.

¿Prefieres escribirnos directamente? activa JavaScript para ver la dirección

Habla con un ingeniero

Sin teatro comercial. Cuéntanos dónde tu operación se siente lenta, repetitiva o difícil — un ingeniero lee cada mensaje.

Tu mensaje llega directamente a nuestros ingenieros en nuestra dirección.