
Un punteggio che misura la memoria, non la capacità.
Misurare un sistema sui casi che sono serviti a costruirlo non dà una cifra ottimistica. Dà una cifra che ordina le opzioni nel modo sbagliato, e fa acquistare la cosa sbagliata.
La trappola scatta nel momento più naturale
Lei costruisce un sistema a partire da un insieme di casi di esempio. Se ne serve per scrivere le regole, scegliere le formulazioni, regolare le corrispondenze. Poi arriva il momento di misurare, e misura su quegli stessi casi, perché sono i soli di cui conosce la risposta giusta.
La cifra ottenuta ha un nome in statistica: è un punteggio di risostituzione. Non misura la capacità del sistema di trattare un fascicolo, misura la sua fedeltà a se stesso. Ed è quasi sempre lusinghiera, perché il sistema è stato plasmato su quei casi precisi.
Il problema non è che sia ottimistica. È che è ottimistica in modo disuguale, e che ordina quindi le opzioni nel modo sbagliato.
Che cosa ha dato la misura
Abbiamo confrontato tre modelli linguistici eseguiti in locale, di dimensioni crescenti, con un codice rigorosamente identico. Due insiemi di casi: quello che era servito alla costruzione, e un insieme di casi reali mai visti.
| Modello locale | Casi di costruzione | Casi mai visti |
|---|---|---|
| Il più piccolo, circa 2 GB | 67% | 15% |
| Intermedio, circa 4,4 GB | 78% | 18% |
| Il più grande, circa 7,1 GB | 89% | 20% |
Ventidue punti di scarto sul corpus di costruzione, cinque punti sul reale. Il piccolo insieme ordinava per bene i modelli secondo la dimensione, che è esattamente la classifica che ci si aspetta di trovare, e quella classifica era falsa. Su uno dei compiti misurati, il modello intermedio superava perfino il più grande.
La conclusione pratica è brutale: sul corpus di costruzione, un modello più grande recita meglio ciò che gli è già stato dato. È memoria, non capacità. Qualunque decisione di acquisto fondata su quella tabella di sinistra sarebbe stata una decisione presa sul rumore.
Il segnale che vale più del punteggio stesso
Una seconda constatazione, tratta dalla stessa campagna, si è rivelata ancora più utile. Due meccanismi senza nulla in comune sono stati misurati sugli stessi casi: da un lato un motore di regole deterministiche, dall'altro un modello linguistico. Hanno raggiunto il tetto nello stesso punto, a qualche decimo di punto l'uno dall'altro.
Questo segnale è facile da ottenere e raramente cercato. Basta disporre di un secondo meccanismo, anche rudimentale, per sapere se il tetto osservato appartiene al sistema o ai dati. Una volta posta la domanda in questi termini, il lavoro cambia natura: si smette di regolare istruzioni, si va a cercare ciò che manca nella materia.
Come premunirsene, in concreto
Bastano quattro gesti, e sono poco costosi rispetto a ciò che evitano.
Separare gli insiemi prima di scrivere la minima regola. Mettere da parte una quota dei casi fin dal primo giorno, non aprirli mai durante la costruzione, e accettare di scoprirli tardi. Un insieme di validazione costituito a posteriori, pescando in ciò che si conosce già, non vale nulla.
Fissare il seme casuale, perché due misure successive siano comparabili. Senza questo, lo scarto tra due versioni si confonde con la variazione da un'estrazione all'altra, e si attribuisce a un miglioramento ciò che è solo caso.
Scomporre per motivo anziché seguire un punteggio globale. Una cifra unica può restare stabile mentre una categoria crolla e un'altra progredisce. Il dettaglio per tipo di caso mostra le regressioni che una media nasconde.
Scrivere l'avvertenza nello strumento di misura stesso. È il gesto più efficace dei quattro. Il nostro banco di valutazione indica esplicitamente, accanto a ogni cifra proveniente dal corpus di costruzione, che si tratta di un punteggio di risostituzione. Una convenzione orale si perde tra due riunioni, una menzione stampata a ogni esecuzione non si perde.
Che cosa questo implica quando Le presentano una cifra
Se un fornitore Le annuncia un tasso di successo, la prima domanda non è il suo valore. È: su quali casi, e quei casi sono serviti a costruire il sistema.
Una risposta imbarazzata a questa domanda dice più della percentuale stessa. E una risposta onesta, del tipo «ecco il punteggio sui casi di costruzione ed ecco quello su casi mai visti, lo scarto è di tanto», indica un fornitore che ha fatto il lavoro, quale che sia lo scarto annunciato.
Applichiamo questa regola alle nostre misure, anche quando lo scarto ci sfavorisce. È il solo modo per rendere una cifra utilizzabile da chi deve decidere.