Parlons de votre projet
Aller au contenu
Toutes les publications

Votre assistant invente sur vos propres documents

Par Docteur en intelligence artificielle · Conseil, conception de systèmes et formation

RAGDiagnosticCoûtMéthode14 août 202610 min

Réentraîner coûte cher et ne corrige rien. Neuf fois sur dix, l'information n'était pas dans ce qui a été fourni au modèle.

Le réflexe, et pourquoi il est faux

Quand un assistant invente sur les documents de l'organisation, le réflexe est de vouloir le réentraîner sur ces documents. C'est la réponse la plus chère et la moins efficace. Elle se fonde sur une intuition raisonnable et fausse.

L'intuition est que le modèle « ne connaît pas » les documents et qu'il faut les lui apprendre. Elle traite le modèle comme une mémoire.

Ce n'est pas ainsi qu'il fonctionne dans une chaîne documentaire. Le modèle ne connaît rien du corpus : il reçoit, à chaque question, quelques extraits sélectionnés par une étape de recherche, et il répond à partir de ceux-là.

Si la réponse est inventée, la question à poser porte donc sur ces extraits, pas sur le modèle.

Le réflexe de réentraîner, écarté, face à la vérification des extraits fournis
Deux réponses possibles, et la coûteuse est presque toujours la mauvaise.

Le diagnostic, en dix minutes

Prendre cinq réponses inventées et vérifier, pour chacune, si l'information correcte figurait dans les extraits fournis au modèle. C'est le seul geste utile avant toute décision.

Le résultat sépare deux causes qui appellent des corrections opposées. Si l'information n'y était pas, le problème est dans la recherche ou dans le corpus. Si elle y était et que la réponse est fausse quand même, le problème est dans le prompt ou dans le modèle.

Sur les systèmes que j'ai examinés, la première cause l'emporte très largement. L'information manquait, et aucun réentraînement ne l'aurait fait apparaître.

Ce diagnostic suppose que les extraits fournis soient journalisés, ce qui est le prérequis de toute exploitation sérieuse, décrit dans l'observabilité des systèmes IA.

Les quatre causes réelles, par fréquence

  • Le document n'est pas dans le corpus, ou n'y est plus. La cause la plus banale et la plus vite corrigée.
  • La recherche ne le retrouve pas, typiquement sur une référence exacte. Voir recherche hybride.
  • Le découpage a séparé l'information de son contexte, une clause de sa condition. Voir découper un document.
  • Le système n'a pas le droit de refuser, et invente pour remplir. Voir le refus de répondre est une fonctionnalité.

Ce que le réglage fin corrige, et ce qu'il ne corrige pas

Il ajuste le style, le format et le registre. Il n'injecte pas de façon fiable des faits, et il ne remplace jamais une recherche défaillante. La distinction est nette et elle est constamment brouillée.

Un modèle réglé finement sur vos documents produira des réponses qui ressemblent à votre documentation. Il continuera d'inventer sur les points précis, parce que la mémorisation d'un fait par ce moyen n'est ni fiable ni vérifiable.

S'y ajoute un coût récurrent qu'on oublie : le modèle réglé devient obsolète quand sa génération de base est dépréciée, deux à trois fois par an, et l'opération doit être refaite.

L'arbitrage complet, avec le calcul de coût, figure dans RAG ou fine-tuning : l'arbitrage par le coût.

Le correctif qui marche presque toujours

Afficher la source de chaque réponse, et autoriser le système à dire qu'il n'a pas trouvé. Ces deux gestes règlent la majorité des situations, et ils coûtent une journée.

L'affichage de la source a un effet immédiat : l'utilisateur voit d'où vient l'information et détecte lui-même l'incohérence. Le système cesse d'être une boîte dont il faut croire les réponses.

L'autorisation de refuser change le comportement sur la classe de cas la plus dangereuse. Un système contraint de répondre invente ; un système qui peut dire « cette information ne figure pas dans les documents que j'ai consultés » est utilisable.

Ce second point demande une consigne explicite et un jeu de tests contenant des questions hors périmètre, faute de quoi la première campagne d'optimisation supprimera le garde-fou.

La question qui remplace le débat sur le réentraînement

« L'information correcte figurait-elle dans les extraits fournis ? » Si la réponse est non, tout budget consacré au modèle est perdu, et le travail est en amont.

Ce qu'il faut expliquer aux utilisateurs

Qu'un système documentaire ne sait rien : il lit ce qu'on lui donne à chaque question. Cette explication en une phrase change la façon dont les utilisateurs formulent et signalent.

Un utilisateur qui croit que le système « connaît » les documents interprète une réponse fausse comme un oubli, et ne la signale pas.

Le même utilisateur, informé du mécanisme, signale autrement : il dit que le bon document n'a pas été trouvé, ce qui est une information exploitable et qui pointe directement la cause.

Cette explication fait partie de ce que je transmets en priorité, parce qu'elle transforme les utilisateurs en source de diagnostic. C'est un des trois gestes décrits dans les trois gestes qui font tenir un système.

La formulation que j'emploie tient en une phrase, et je la fais figurer dans l'interface elle-même quand c'est possible : ce système ne connaît pas vos documents, il en consulte quelques-uns à chaque question et répond à partir de ceux-là. Les utilisateurs qui l'ont lue signalent des problèmes de recherche là où les autres signalaient des erreurs de modèle, et l'écart de qualité du diagnostic est considérable.

Questions fréquentes

Faut-il réentraîner le modèle sur ses documents ?

Presque jamais. Le modèle ne connaît pas le corpus : il répond à partir d'extraits sélectionnés à chaque question. Si la réponse est inventée, la cause est dans ces extraits.

Comment diagnostiquer en dix minutes ?

En prenant cinq réponses inventées et en vérifiant si l'information correcte figurait dans les extraits fournis. Cela sépare un problème de recherche d'un problème de prompt.

Que corrige un réglage fin ?

Le style, le format et le registre. Il n'injecte pas de faits de façon fiable, et il devient obsolète quand sa génération de base est dépréciée, deux à trois fois par an.

Quel correctif marche presque toujours ?

Afficher la source de chaque réponse et autoriser le système à dire qu'il n'a pas trouvé. Deux gestes, une journée, et la majorité des situations est réglée.

Votre prochain projetParlons-en.Réserver un échange de 15 minutes sur Cal.com, dans un nouvel onglet