Assistant documentaire (RAG) sur vos documents
Des réponses tirées de vos documents, avec le passage source à l'appui.
Pour les équipes qui cherchent leurs réponses dans des procédures, des catalogues, des contrats ou des cahiers des charges dispersés. L'assistant retrouve les passages pertinents, rédige une réponse appuyée sur eux et cite ses sources.
La situation de départ
L'information existe, mais elle est répartie entre des dossiers partagés, des PDF, un intranet et la mémoire de quelques personnes. Chercher prend du temps, et la réponse dépend de qui l'on interroge. Un assistant généraliste, lui, répond avec aplomb sans connaître vos documents, ignore ce qui a changé récemment et ne peut pas montrer d'où vient ce qu'il affirme. Pour un usage professionnel, une réponse sans source ne vaut pas grand-chose : il faut pouvoir la vérifier dans le texte d'origine.
Ce que vous obtenez
Une chaîne d'import de vos documents
Extraction du texte (PDF, pages web, fichiers bureautiques), contrôle de qualité, métadonnées, version et date de chaque document.
Un découpage adapté à vos contenus
Nous choisissons la stratégie de découpage selon la nature des documents, en partant de la plus simple et en mesurant la qualité avant de la complexifier.
Un index vectoriel cloisonné
Plongements stockés dans PostgreSQL avec pgvector, recherche filtrée par espace client ou par droit d'accès, isolation par règles de sécurité au niveau des lignes.
Des réponses avec citations
La réponse est générée à partir des seuls extraits retrouvés et renvoie au passage d'origine. Sans passage pertinent, l'assistant dit qu'il ne peut pas conclure.
Un jeu de questions de référence
Des questions types et leurs réponses attendues, rejouées après chaque changement de modèle, de consigne ou de corpus.
Une procédure de mise à jour
Ajout, remplacement et retrait de documents, avec répercussion dans l'index, y compris quand un accès est révoqué.
Comment nous procédons
Inventorier le corpus
Quels documents, quels formats, quels droits d'accès, quelles données sensibles. Nous écartons ce qui ne doit pas être indexé.
Construire l'index et la recherche
Extraction, découpage, plongements, recherche par similarité, puis réglage sur vos questions réelles.
Évaluer la fidélité aux sources
Tests sur le jeu de référence : réponse fondée, abstention quand le corpus ne permet pas de conclure, cloisonnement entre espaces.
Brancher le canal
Interface web, outil interne, chat ou agent vocal, selon l'endroit où vos équipes posent leurs questions.
La preuve par nos réalisations
Niveau de preuve de ce service : en production.
Dictova
Une base de connaissances par client dans PostgreSQL et pgvector, isolée par espace, où le corpus l'emporte sur la consigne donnée au modèle. Les faits sont extraits et les contradictions détectées.
EraCoach
Un fonds documentaire découpé et indexé dans une base vectorielle alimente la rédaction des articles du blog, avec dédoublonnage sémantique des sujets par plongements.
Technologies
Questions fréquentes
Qu'est-ce qui empêche l'assistant d'inventer une réponse ?
Il ne reçoit que les extraits retrouvés dans vos documents et doit citer le passage utilisé. Quand la recherche ne ramène rien de pertinent, la consigne est de s'abstenir. Nous vérifions ce comportement sur un jeu de questions de référence, y compris des questions sans réponse dans le corpus.
Nos documents servent-ils à entraîner un modèle ?
Non, pas dans ce montage. Vos documents sont indexés dans une base que vous contrôlez et seuls les extraits utiles à une question sont transmis au modèle. Les conditions du fournisseur retenu sur la conservation et l'entraînement sont vérifiées et écrites dans le projet.
Chaque employé voit-il les mêmes documents ?
Non, si vous le souhaitez. La recherche est filtrée par espace et par droit d'accès, au niveau de la base de données. Un document retiré ou un accès révoqué disparaît des réponses après mise à jour de l'index.
Quels formats de documents acceptez-vous ?
Les PDF, les pages web et les fichiers bureautiques courants. Les documents numérisés passent par une reconnaissance de caractères, dont la qualité dépend de la mise en page. Nous testons un échantillon de vos documents avant de nous engager sur un périmètre.
Peut-on le relier à nos outils actuels ?
Oui. L'assistant s'expose par une API et peut être intégré à un site, à un outil interne ou à un agent conversationnel. Les connecteurs vers vos sources de documents sont définis au cadrage.
Quel problème voulez-vous régler ?
Décrivez votre activité, votre besoin et les personnes concernées. Nous préparons un premier échange à partir de là.