Preparación del corpus
Los documentos se parsean, trocean y limpian. Los PDF escaneados, las tablas y las versiones duplicadas se tratan de forma explícita en lugar de degradar las respuestas en silencio.
Sistemas RAG
Un modelo general adivina. Un sistema de recuperación lo consulta. Conectamos tus contratos, manuales, políticas y tickets a una capa de preguntas y respuestas que cita el pasaje detrás de cada respuesta, y que dice que no lo sabe cuando el corpus no lo dice.
Los documentos se parsean, trocean y limpian. Los PDF escaneados, las tablas y las versiones duplicadas se tratan de forma explícita en lugar de degradar las respuestas en silencio.
Construimos un conjunto de preguntas a partir de preguntas reales de usuarios y ajustamos la recuperación contra él, para que la calidad sea un número que puedes vigilar y no una impresión.
La recuperación respeta las reglas de acceso de los sistemas de origen. Nadie recibe un pasaje de un documento que no podría abrir por sí mismo.
Cada respuesta enlaza al pasaje del que salió, y las preguntas de baja confianza devuelven un rechazo con los documentos más cercanos en lugar de una respuesta inventada.
Una pregunta respondida, con la traza que ve quien revisa.
pregunta "¿puede un distribuidor devolver unidades abiertas tras 30 días?"
recuperado contrato-distribucion-2025.pdf p.12 score 0.83
politica-devoluciones-v4.md seccion 3.2 score 0.79
respuesta No. Las unidades abiertas solo se devuelven dentro de 30 días,
y solo con el embalaje original (contrato 7.4).
citado contrato-distribucion-2025.pdf, p.12, cláusula 7.4
confianza alta permisos: requiere rol partner-portal
fallback por debajo de 0.55 -> rechaza y muestra los 3 documentos más cercanos
Ejemplo ilustrativo, no es un corpus real de cliente.
Un modelo general responde de memoria y suena igual de seguro cuando se equivoca. Un sistema de recuperación busca primero en tu corpus, responde solo con lo que encontró y enlaza el pasaje que usó. Además rechaza responder cuando los documentos no contienen la respuesta, algo que una ventana de chat casi nunca hace.
Contratos, manuales, políticas, wikis, hojas de cálculo, tickets de soporte e hilos de correo. Los PDF escaneados pasan por OCR, las tablas se extraen en vez de aplanarse en ruido, y las versiones duplicadas del mismo documento se resuelven de forma explícita para que el sistema no cite la obsoleta.
Sí. La recuperación se filtra por las reglas de acceso de los sistemas de origen, así que nadie recibe un pasaje de un documento que no podría abrir por sí mismo. Los cambios de permisos en el origen se propagan, en lugar de copiarse una sola vez al indexar.
El sistema devuelve un rechazo junto con los documentos más cercanos que sí encontró, para que la persona juzgue por su cuenta. Una respuesta equivocada que suena autorizada cuesta mucho más que un honesto ‘esto no está escrito en ningún sitio que yo pueda ver’.
La respuesta suele estar ya escrita en algún sitio que nadie encuentra. Ese es el problema que esto resuelve.
Agenda tu consulta gratuita