Analysen · Architektur

Die Schwelle muss die Antwort filtern, nicht die Anzeige.

Einen Auszug aus der Quellenliste zu streichen hindert ihn nicht daran, den erzeugten Text zu beeinflussen. Das Ergebnis ist eine verunreinigte Antwort, die sauber aussieht. Wo die Schwelle anzusetzen ist, wie man sie wählt, und warum diese Wahl dem Fachbereich gehört.

Die Schwelle filtert die Anzeige, oder sie filtert die Antwort

Ein System, das aus Dokumenten antwortet, wählt zunächst einige davon aus. Zu dieser Auswahl gehört ein Relevanzwert und eine Schwelle, unterhalb deren ein Auszug als themenfremd gilt. Bis hierhin machen es alle gleich.

Die Frage, die alles ändert, ist die nach der Stelle, an der die Schwelle greift. In vielen Umsetzungen filtert sie die Liste der angezeigten Quellen unter der Antwort. Die aussortierten Auszüge werden weiterhin an das Modell übergeben, beeinflussen also den erzeugten Text, und der Leser sieht eine Antwort mit drei sauberen Quellen, ohne zu wissen, dass sich die Herleitung auf fünf weitere gestützt hat, die das System selbst als nicht relevant eingestuft hatte.

Das ist das Schlechteste aus beiden Welten: Die Antwort ist mit Themenfremdem verunreinigt, und die Anzeige erweckt den gegenteiligen Eindruck. Wer die genannten Quellen nachprüft, wird nichts Auffälliges finden, denn genau die problematischen wurden ihm aus dem Blick genommen.

Die Schwelle muss also vorher greifen, auf dem, was dem Modell übergeben wird. Ein Auszug unter der Schwelle geht nicht in die Antwort ein, weil er nicht in die Frage eingeht. Beim Schreiben ist das eine Zeile Unterschied, im Gebrauch ein Unterschied der Art.

Und wenn nichts mehr die Schwelle überschreitet

Die logische Folge bringt die meisten Projekte in Verlegenheit: Überschreitet kein Auszug die Schwelle, bleibt nichts zu übergeben. Das System muss dann sagen, dass der Punkt nicht abgedeckt ist.

Dieses Verhalten ist am schwersten zu vermitteln, weil es wie ein Ausfall aussieht. Ein System, das immer antwortet, wirkt funktionstüchtiger, besonders in der Vorführung, wo die gestellten Fragen konstruktionsbedingt in den Perimeter fallen.

Dabei ist die Frage ausserhalb des Perimeters bei einem abgegrenzten Dokumentenkorpus kein Ausnahmefall. Nach einigen Wochen im Einsatz ist sie der häufigste Fall, sobald die Nutzer aufhören, die vorgeführten Fragen zu stellen, und beginnen, ihre eigenen zu stellen.

Wie man eine Schwelle wählt, da sie sich nicht erraten lässt

Eine Schwelle ist keine Konstante, die man aus einem im Netz gefundenen Beispiel übernimmt. Sie ist eine Abwägung zwischen zwei gegenläufigen Fehlern, und sie wird gemessen.

Eine zu tiefe Schwelle lässt Themenfremdes durch: Das System antwortet mit Sicherheit und stützt sich dabei auf Auszüge, die nichts belegen. Eine zu hohe Schwelle erzeugt den umgekehrten Fehler, unauffälliger und nicht weniger teuer: Das System erklärt einen Punkt für nicht abgedeckt, den es abdeckt, und der Nutzer schliesst daraus, dass das Werkzeug nichts kann.

Die Methode besteht darin, einen Satz Fragen zusammenzustellen, deren Antwort man kennt, darin bewusst auch Fragen ausserhalb des Perimeters, dann die Schwelle zu variieren und zwei Quoten zu erheben: den Anteil trotzdem erzeugter falscher Antworten und den Anteil unberechtigter Schweigefälle. Diese beiden Kurven kreuzen sich, und der Arbeitspunkt wird danach gewählt, welcher der beiden Fehler in Ihrem Geschäft teurer kommt.

Diese Wahl ist keine technische, sie ist eine fachliche. Bei einer internen Recherche ist ein Schweigen zu viel eine Unannehmlichkeit. Bei einem verbindlichen Dokument ist eine falsche Antwort zu viel ein Vorfall. Derselbe Motor wird in beiden Fällen nicht gleich eingestellt, und entscheiden muss der Kunde, nicht der Anbieter.

Die Schwelle ersetzt die Passungsprüfung nicht

Ein Punkt zur Wachsamkeit, denn man hält das Problem schnell für gelöst. Ein Auszug kann die Schwelle überschreiten, zum Thema wirklich relevant sein und die gestellte Frage trotzdem nicht beantworten.

Relevanz misst thematische Nähe. Sie misst nicht, dass darin eine Antwort steht. Ein zum behandelten Thema einwandfrei relevantes Dokument kann bloss eine Definition sein, ein Verweis, oder den Regelfall behandeln, während die Frage eine Ausnahme betrifft. Die Schwelle sieht diesen Unterschied nicht, und keine Einstellung wird ihn sie sehen lassen.

Es braucht daher eine zweite, eigene Prüfung, die den ausgewählten Inhalt der tatsächlichen Anfrage gegenüberstellt. Ihre Notwendigkeit haben wir in unserer Notiz zum Ursprung der Fehler beschrieben: Es ist die Kategorie von Fehlschlägen, die kein leistungsfähigeres Modell verringert.

Die drei Fragen, die zu stellen sind

Bei einem System zur Dokumentensuche genügen drei Fragen, um zu wissen, ob es gebaut oder bloss zusammengesteckt wurde.

Filtert die Schwelle, was an das Modell geht, oder nur, was unter der Antwort angezeigt wird. Was tut das System, wenn nichts die Schwelle überschreitet, und lässt sich das auf der Stelle an einer bewusst ausserhalb des Perimeters gestellten Frage vorführen. Wie wurde der Wert der Schwelle gewählt, und auf welchem Fragensatz.

Die dritte trennt am schärfsten. Ein Wert, der aus einem im Netz gefundenen Beispiel übernommen wurde, ohne Testdatensatz dahinter, bedeutet, dass niemand gemessen hat, was das System durchlässt und was es zu Unrecht verweigert.

Ein Problem schildern →