Ir al contenido

Sistemas RAG

Respuestas de tus documentos, con el comprobante adjunto

Un modelo general adivina. Un sistema de recuperación lo consulta. Conectamos tus contratos, manuales, políticas y tickets a una capa de preguntas y respuestas que cita el pasaje detrás de cada respuesta, y que dice que no lo sabe cuando el corpus no lo dice.

Qué incluye

Preparación del corpus

Los documentos se parsean, trocean y limpian. Los PDF escaneados, las tablas y las versiones duplicadas se tratan de forma explícita en lugar de degradar las respuestas en silencio.

Recuperación que se mide

Construimos un conjunto de preguntas a partir de preguntas reales de usuarios y ajustamos la recuperación contra él, para que la calidad sea un número que puedes vigilar y no una impresión.

Permisos preservados

La recuperación respeta las reglas de acceso de los sistemas de origen. Nadie recibe un pasaje de un documento que no podría abrir por sí mismo.

Citas y rechazos

Cada respuesta enlaza al pasaje del que salió, y las preguntas de baja confianza devuelven un rechazo con los documentos más cercanos en lugar de una respuesta inventada.

Ejemplo de salida

Una pregunta respondida, con la traza que ve quien revisa.

pregunta   "¿puede un distribuidor devolver unidades abiertas tras 30 días?"
recuperado contrato-distribucion-2025.pdf p.12   score 0.83
           politica-devoluciones-v4.md  seccion 3.2  score 0.79
respuesta  No. Las unidades abiertas solo se devuelven dentro de 30 días,
           y solo con el embalaje original (contrato 7.4).
citado     contrato-distribucion-2025.pdf, p.12, cláusula 7.4
confianza  alta      permisos: requiere rol partner-portal
fallback   por debajo de 0.55 -> rechaza y muestra los 3 documentos más cercanos

Ejemplo ilustrativo, no es un corpus real de cliente.

Preguntas frecuentes

¿En qué se diferencia de pegar nuestros documentos en ChatGPT?

Un modelo general responde de memoria y suena igual de seguro cuando se equivoca. Un sistema de recuperación busca primero en tu corpus, responde solo con lo que encontró y enlaza el pasaje que usó. Además rechaza responder cuando los documentos no contienen la respuesta, algo que una ventana de chat casi nunca hace.

¿Qué tipo de documentos admite?

Contratos, manuales, políticas, wikis, hojas de cálculo, tickets de soporte e hilos de correo. Los PDF escaneados pasan por OCR, las tablas se extraen en vez de aplanarse en ruido, y las versiones duplicadas del mismo documento se resuelven de forma explícita para que el sistema no cite la obsoleta.

¿Respeta los permisos que ya tenemos?

Sí. La recuperación se filtra por las reglas de acceso de los sistemas de origen, así que nadie recibe un pasaje de un documento que no podría abrir por sí mismo. Los cambios de permisos en el origen se propagan, en lugar de copiarse una sola vez al indexar.

¿Qué pasa cuando la respuesta no está en los documentos?

El sistema devuelve un rechazo junto con los documentos más cercanos que sí encontró, para que la persona juzgue por su cuenta. Una respuesta equivocada que suena autorizada cuesta mucho más que un honesto ‘esto no está escrito en ningún sitio que yo pueda ver’.

Si tu equipo repite siempre la misma pregunta

La respuesta suele estar ya escrita en algún sitio que nadie encuentra. Ese es el problema que esto resuelve.

Agenda tu consulta gratuita