Analyses · Évaluation

Un score qui mesure la mémoire, pas la capacité.

Mesurer un système sur les cas qui ont servi à le construire ne donne pas un chiffre optimiste. Cela donne un chiffre qui classe les options dans le mauvais ordre, et fait acheter la mauvaise chose.

Le piège se referme au moment le plus naturel

Vous construisez un système à partir d'un ensemble de cas d'exemple. Vous vous en servez pour écrire les règles, choisir les formulations, régler les correspondances. Puis vient le moment de mesurer, et vous mesurez sur ces mêmes cas, parce que ce sont les seuls dont vous connaissez la bonne réponse.

Le chiffre obtenu porte un nom en statistique : c'est un score de resubstitution. Il ne mesure pas la capacité du système à traiter un dossier, il mesure sa fidélité à lui-même. Et il est presque toujours flatteur, parce que le système a été façonné sur ces cas précis.

Le problème n'est pas qu'il soit optimiste. C'est qu'il est optimiste de façon inégale, et qu'il classe donc les options dans le mauvais ordre.

Ce que la mesure a donné

Nous avons comparé trois modèles de langage exécutés localement, de tailles croissantes, avec un code strictement identique. Deux jeux de cas : celui qui avait servi à la construction, et un ensemble de cas réels jamais vus.

Modèle localCas de constructionCas jamais vus
Le plus petit, environ 2 Go67 %15 %
Intermédiaire, environ 4,4 Go78 %18 %
Le plus gros, environ 7,1 Go89 %20 %

Vingt-deux points d'écart sur le corpus de construction, cinq points sur le réel. Le petit jeu classait proprement les modèles par taille, ce qui est exactement le classement qu'on s'attend à trouver, et ce classement était faux. Sur l'une des tâches mesurées, le modèle intermédiaire dépassait même le plus gros.

La conclusion pratique est brutale : sur le corpus de construction, un modèle plus gros récite mieux ce qu'on lui a déjà donné. C'est de la mémoire, pas de la capacité. Toute décision d'achat fondée sur ce tableau de gauche aurait été une décision prise sur du bruit.

Le signal qui vaut plus que le score lui-même

Un second constat, issu de la même campagne, s'est révélé plus utile encore. Deux mécanismes sans rien de commun ont été mesurés sur les mêmes cas : d'un côté un moteur de règles déterministes, de l'autre un modèle de langage. Ils ont plafonné au même endroit, à quelques dixièmes de point l'un de l'autre.

Quand deux mécanismes indépendants butent sur la même valeur, ce n'est pas le mécanisme qui limite. C'est la matière. Continuer à optimiser le moteur revient alors à changer d'outil pour percer un mur qui n'a pas de porte.

Ce signal est facile à obtenir et rarement cherché. Il suffit de disposer d'un second mécanisme, même rudimentaire, pour savoir si le plafond observé appartient au système ou aux données. Une fois la question posée dans ces termes, le travail change de nature : on cesse de régler des instructions, on va chercher ce qui manque dans la matière.

Comment s'en prémunir, concrètement

Quatre gestes suffisent, et ils sont peu coûteux comparés à ce qu'ils évitent.

Séparer les jeux avant d'écrire la moindre règle. Mettre de côté une part des cas dès le premier jour, ne jamais les ouvrir pendant la construction, et accepter de les découvrir tard. Un jeu de validation constitué après coup, en piochant dans ce qu'on connaît déjà, ne vaut rien.

Fixer la graine aléatoire, pour que deux mesures successives soient comparables. Sans cela, l'écart entre deux versions se confond avec la variation d'un tirage à l'autre, et on attribue à une amélioration ce qui n'est que du hasard.

Décomposer par motif plutôt que de suivre un score global. Un chiffre unique peut rester stable pendant qu'une catégorie s'effondre et qu'une autre progresse. Le détail par type de cas montre les régressions qu'une moyenne cache.

Écrire l'avertissement dans l'outil de mesure lui-même. C'est le geste le plus efficace des quatre. Notre harnais d'évaluation affiche explicitement, à côté de tout chiffre issu du corpus de construction, qu'il s'agit d'un score de resubstitution. Une convention orale se perd entre deux réunions, une mention imprimée à chaque exécution ne se perd pas.

Ce que cela implique quand on vous présente un chiffre

Si un prestataire vous annonce un taux de réussite, la première question n'est pas sa valeur. C'est : sur quels cas, et ces cas ont-ils servi à construire le système.

Une réponse embarrassée à cette question en dit plus long que le pourcentage lui-même. Et une réponse honnête, du type « voici le score sur les cas de construction et voici celui sur des cas jamais vus, l'écart est de tant », indique un fournisseur qui a fait le travail, quel que soit l'écart annoncé.

Nous appliquons cette règle à nos propres mesures, y compris quand l'écart nous dessert. C'est le seul moyen de rendre un chiffre utilisable par quelqu'un qui doit décider.

Exposer un problème →