Analysen · Methode

Eine Wissensbasis aus Textdateien.

Was einen Korpus für eine KI verwertbar macht, ist weder sein Umfang noch die Software, die ihn beherbergt. Es ist, dass er in Klartext vorliegt, in Einheiten geschnitten ist, die für sich stehen, und explizit verknüpft ist. Gemessen an unserem eigenen.

Was Obsidian wirklich ist

Obsidian ist keine Notiz-Anwendung, die Ihre Daten irgendwo ablegt. Es ist ein Ordner mit Textdateien auf Ihrer Festplatte, den die Software lediglich anzeigt. Jede Notiz ist eine Datei im Markdown-Format, lesbar in jedem beliebigen Editor, versionierbar, kopierbar, sicherbar wie jedes andere Dokument.

Diese Eigenschaft wirkt belanglos und ändert alles. Es gibt keine proprietäre Datenbank zu exportieren, keine Programmierschnittstelle zu beantragen, kein Abfragelimit, kein Format, das man nachbauen müsste, sobald der Hersteller sein Geschäftsmodell ändert. An dem Tag, an dem Sie mit Ihren Notizen etwas anderes anfangen wollen, liegen sie bereits im einzigen Format vor, das alles lesen kann.

Das Kriterium ist nicht der Name der Software. Es ist die Eigenschaft: Textdateien, im Klartext, auf einem Datenträger, den Sie kontrollieren, explizit untereinander verknüpft. Mehrere Werkzeuge bieten das. Viele andere, in Unternehmen weit verbreitet, bieten es nicht, und genau dort versanden die Projekte zur dokumentenbasierten künstlichen Intelligenz.

Warum das der richtige Untergrund für eine KI ist

Ein System, das aus Ihren Dokumenten antworten soll, beginnt immer mit derselben undankbaren Arbeit: sie holen, sie umwandeln, den Text herausziehen, ihre Struktur erraten. In einem betrieblichen Zusammenarbeitsraum verschlingt dieser Schritt den grössten Teil des Projekts, und er erzeugt eine Kopie, die schon am Tag darauf nicht mehr synchron ist.

Mit Textdateien entfällt dieser Schritt. Der Inhalt ist bereits Text, die Struktur ist bereits durch die Titel ausgezeichnet, und die Aktualisierung ist die Datei selbst. Ein System zur Dokumentensuche liest den Ordner, sonst nichts.

Die Versionierung gibt es obendrein. Ein Ordner mit Textdateien lässt sich unter Versionsverwaltung stellen, was zwei seltene Dinge liefert: die Historie, wer was wann geschrieben hat, und vor allem die Möglichkeit, nur das zu verarbeiten, was sich geändert hat. Bei einem lebenden Korpus ist der Unterschied zwischen einer täglichen und einer monatlichen Verarbeitung genau der, ob man nur die Differenzen oder das Ganze neu verarbeitet.

Der Graph wird von Hand gelegt, nicht erraten

Das ist die am meisten unterschätzte Eigenschaft. In diesen Werkzeugen verweist eine Notiz über einen expliziten Link auf eine andere. In einem sauber geführten Arbeitstresor liegt die Dichte, die wir feststellen, bei rund fünf Links pro Notiz, wobei fast neun von zehn Notizen mit mindestens einer weiteren verbunden sind.

Diese Links sind eine Information, die niemand rekonstruieren muss. Eine klassische Dokumentensuche bringt Dokumente über statistische Ähnlichkeit zusammen, was schlecht funktioniert, sobald zwei Texte dasselbe mit anderen Wörtern sagen oder dieselben Wörter für Verschiedenes verwenden. Ein Link, den die schreibende Person gesetzt hat, sagt etwas, was Ähnlichkeit nie sagen wird: dass diese beiden Notizen zusammenhängen, und wie.

Konkret erlaubt das eine Suche in zwei Schritten: die relevanteste Notiz finden, dann ihren Links folgen, um ihre Nachbarschaft mitzunehmen. Das Ergebnis ist genauer und deutlich schlanker als eine Ähnlichkeitssuche, die breit streut, um nichts zu verpassen.

Der wahre Kostenpunkt ist nicht die Speicherung, es ist der Kontext

Das ist die Frage, die über die Machbarkeit eines Projekts entscheidet, und sie wird fast immer verkehrt herum gestellt. Notizen zu speichern kostet nichts. Was kostet, ist das, was man dem Modell bei jeder Frage schickt.

Was für die Antwort auf eine Frage gesendet wirdToken
Eine gut geschnittene Notiz, Medianwert≈ 1’200
Drei von der Suche gezielt ausgewählte Notizen≈ 3’600
Der ganze Korpus, auf einem realen Tresor×71

Einundsiebzigmal. Und das Wesentliche ist nicht die Ausgabe: Die teure Variante ist zugleich die unzuverlässigere. Die Fähigkeit eines Modells, eine Information zu verwerten, nimmt je nach Position dieser Information in einem stark gefüllten Kontext ab, und was in der Mitte einer sehr langen Menge steht, wird deutlich schlechter genutzt als das, was an den Rändern steht. Alles zu senden kostet mehr und antwortet schlechter.

Aus diesem Grund ist das Verkaufsargument des sehr grossen Kontextfensters mit Misstrauen aufzunehmen. Es verkauft ein Merkmal des Modellanbieters, als wäre es eine Eigenschaft des Systems, während die eigentliche Frage die Güte der vorgelagerten Auswahl ist. Wir führen das in unserer Notiz zur gebändigten KI aus.

Zur Zählmethode. Diese Werte stammen von einem Standard-Tokenizer, angewandt auf unsere realen Dateien. Die genaue Zahl schwankt von Modell zu Modell um einige Prozent. Das Verhältnis zwischen den beiden Spalten bleibt dagegen stabil, und es trägt das Argument. Nebenbei bemerkt verbraucht Französisch mehr als Englisch, rund 3,2 Zeichen pro Token in unserem Korpus, was Schätzungen auf Basis englischsprachiger Quellen übersehen.

Das Format kostet, bei identischem Inhalt

Auch die Auszeichnung zählt. Wir haben eine unserer veröffentlichten Seiten genommen und dreimal dasselbe gezählt: die Seite, wie sie ausgeliefert wird, ihren Artikel allein samt Auszeichnungen, und den blossen Text.

Derselbe InhaltToken
Die vollständige Seite, wie ausgeliefert4’388
Der Artikel allein, Auszeichnungen inbegriffen2’644
Der blosse Text2’012

Die ganze Seite kostet mehr als das Doppelte des Textes, den sie trägt. Dieser Aufschlag besteht aus Auszeichnung, Navigation und Metadaten, für ein Modell also aus Rauschen. Bei einem Bürodokument oder einem Export aus einem Zusammenarbeitsraum ist das Verhältnis oft schlechter, und niemand schaut es an.

Markdown steht am anderen Ende: Es bewahrt die nützliche Struktur, Titel, Listen, Hervorhebungen, mit einer Auszeichnung von wenigen Zeichen. Es ist das Format, das pro Token am meisten Sinn transportiert.

Was das von der schreibenden Person verlangt

Ein gut geführter Tresor lässt sich nicht verordnen. Drei Disziplinen genügen, und es sind genau jene, die die Dokumentensuche später wirksam machen.

Eine Notiz behandelt ein Thema und nur eines. Nur so lässt sie sich vollständig heranziehen, ohne Themenfremdes mitzuschleppen, und nur so erspart man sich, sie später künstlich zu zerschneiden. Der Titel kündigt an, was die Notiz enthält, nicht die Kategorie, zu der sie gehört: Oft entscheidet der Titel darüber, ob eine Notiz gefunden wird. Und die Links werden beim Schreiben gesetzt, nicht in einer Aufräumsitzung, die nie stattfindet.

Eine vierte Praxis macht mehr aus als die drei anderen zusammen: eine Indexnotiz führen, die in einer Zeile den Inhalt jeder anderen Notiz angibt. Sie ermöglicht die erste Auswahl, ohne sonst etwas zu lesen, zum Preis von einigen hundert Token.

Was diese Wahl nicht leistet

Eine Methode, die keine Grenzen ausweist, ist nicht erprobt worden. Diese hier hat vier Nachteile, und sie fallen ins Gewicht.

Ein Dateiordner ist kein Mehrbenutzersystem. Es gibt keine feinen Rechte pro Dokument, kein bequemes gleichzeitiges Bearbeiten, keinen Prüfpfad im Sinne eines Dokumentenmanagementsystems. Für einen Korpus, den eine ganze Organisation mit abgestuften Berechtigungen teilen soll, ist es das falsche Werkzeug, und man muss zu einer anderen Architektur stehen.

Die Qualität des Graphen hängt vollständig von der Disziplin der Schreibenden ab. Eine Dichte von fünf Links pro Notiz ist keine Eigenschaft der Software, sondern eine gepflegte Gewohnheit. Ein vernachlässigter Tresor bietet keinen der oben beschriebenen Vorteile.

Markdown gibt komplexe Tabellen und Dokumente mit festgelegtem Layout schlecht wieder. Eine Vereinbarung, ein Vertrag oder ein formatierter Bericht bleiben Bürodokumente und sind als solche zu behandeln. Und Dateien auf einem Arbeitsplatz sind nur dann gesichert, wenn jemand sie sichert, was selbstverständlich klingt bis zu dem Tag, an dem die Festplatte stehen bleibt.

Diese Grenzen umreissen einen Einsatzbereich, statt ihn zu verwerfen: eine Arbeitswissensbasis, geführt von einem kleinen Team, dazu bestimmt, befragt zu werden. Genau in diesem Fall entscheidet der weiter oben gemessene Verbrauchsunterschied darüber, ob ein Projekt machbar ist oder nicht.

Zur Verschlechterung der Verwertung einer Information je nach ihrer Position in einem stark gefüllten Kontext siehe die unter dem Namen «lost in the middle» veröffentlichten Arbeiten (Liang et al.).

Ein Problem schildern →