
Le seuil doit filtrer la réponse, pas l'affichage.
Écarter un extrait de la liste des sources ne l'empêche pas d'influencer le texte produit. Le résultat est une réponse contaminée qui a l'air propre. Où placer le seuil, comment le choisir, et pourquoi ce choix appartient au métier.
Le seuil filtre l'affichage, ou il filtre la réponse
Un système qui répond à partir de documents commence par en sélectionner quelques-uns. Cette sélection s'accompagne d'un score de pertinence, et d'un seuil en dessous duquel un extrait est jugé hors sujet. Jusqu'ici, tout le monde fait pareil.
La question qui change tout est celle de l'endroit où le seuil s'applique. Dans beaucoup d'implémentations, il filtre la liste des sources affichées sous la réponse. Les extraits écartés continuent d'être transmis au modèle, ils influencent donc le texte produit, et le lecteur voit une réponse accompagnée de trois sources propres sans savoir que le raisonnement s'est appuyé sur cinq autres, jugées non pertinentes par le système lui-même.
Le seuil doit donc s'appliquer avant, sur ce qu'on transmet au modèle. Un extrait sous le seuil n'entre pas dans la réponse parce qu'il n'entre pas dans la question. C'est un changement d'une ligne à l'écriture et d'une nature entière à l'usage.
Et quand plus rien ne passe le seuil
La conséquence logique embarrasse la plupart des projets : si aucun extrait ne franchit le seuil, il ne reste rien à transmettre. Le système doit alors dire que le point n'est pas couvert.
C'est le comportement le plus difficile à faire accepter, parce qu'il ressemble à une panne. Un système qui répond toujours paraît fonctionner mieux, surtout en démonstration, où les questions posées tombent par construction dans le périmètre.
Pourtant, sur un corpus documentaire délimité, la question hors périmètre n'est pas un cas rare. C'est le cas le plus fréquent après quelques semaines d'usage, quand les utilisateurs cessent de poser les questions qu'on leur a montrées et commencent à poser les leurs.
Comment on choisit un seuil, puisqu'il ne se devine pas
Un seuil n'est pas une constante que l'on reprend d'un exemple trouvé en ligne. C'est un arbitrage entre deux erreurs opposées, et il se mesure.
Un seuil trop bas laisse passer du hors-sujet : le système répond avec assurance en s'appuyant sur des extraits qui ne fondent rien. Un seuil trop haut produit l'erreur inverse, plus discrète et non moins coûteuse : le système déclare ne pas couvrir un point qu'il couvre, et l'utilisateur conclut que l'outil ne sait rien faire.
La méthode consiste à constituer un jeu de questions dont on connaît la réponse, en y incluant délibérément des questions hors périmètre, puis à faire varier le seuil et à relever deux taux : la proportion de réponses fausses produites malgré tout, et la proportion de silences injustifiés. Ces deux courbes se croisent, et le point de fonctionnement se choisit selon celle des deux erreurs qui coûte le plus cher dans votre métier.
Le seuil ne remplace pas la vérification d'adéquation
Un point de vigilance, parce qu'il est facile de croire le problème résolu. Un extrait peut franchir le seuil, être authentiquement pertinent sur le sujet, et ne pas répondre à la question posée.
La pertinence mesure une proximité de sujet. Elle ne mesure pas qu'une réponse s'y trouve. Un document parfaitement pertinent sur le thème abordé peut n'être qu'une définition, un renvoi, ou traiter le cas général quand la question porte sur une exception. Le seuil ne voit pas cette différence, et aucun réglage ne la lui fera voir.
Il faut donc une seconde vérification, distincte, qui confronte le contenu retenu à la demande réelle. Nous en avons décrit la nécessité dans notre note sur l'origine des erreurs : c'est la catégorie d'échec qu'aucun modèle plus performant ne réduit.
Les trois questions à poser
Face à un système de recherche documentaire, trois questions suffisent à savoir s'il a été construit ou seulement assemblé.
Le seuil filtre-t-il ce qui est envoyé au modèle, ou seulement ce qui est affiché sous la réponse. Que fait le système quand rien ne passe le seuil, et peut-on en faire la démonstration séance tenante sur une question volontairement hors périmètre. Comment la valeur du seuil a-t-elle été choisie, et sur quel jeu de questions.
La troisième est la plus discriminante. Une valeur reprise d'un exemple trouvé en ligne, sans jeu de test derrière, signifie que personne n'a mesuré ce que le système laisse passer ni ce qu'il refuse à tort.