
Una base di conoscenza in file di testo.
Ciò che rende un corpus sfruttabile da un'IA non è né il suo volume né il software che lo ospita. È che sia in testo semplice, suddiviso in unità che stanno in piedi da sole, e collegato in modo esplicito. Misurato sul nostro.
Che cos'è davvero Obsidian
Obsidian non è un'applicazione per prendere appunti che immagazzina i Suoi dati da qualche parte. È una cartella di file di testo sul Suo disco, che il software si limita a visualizzare. Ogni nota è un file in formato Markdown, leggibile in qualsiasi editor, versionabile, copiabile, salvabile come qualunque altro documento.
Questa proprietà sembra insignificante e cambia tutto. Non c'è una base dati proprietaria da esportare, nessuna interfaccia di programmazione da richiedere, nessun limite di chiamate, nessun formato da ricostruire a ritroso il giorno in cui l'editore cambia modello economico. Il giorno in cui vorrà fare altro delle Sue note, esse sono già nel solo formato che tutto sa leggere.
Perché è il substrato giusto per un'IA
Un sistema che deve rispondere a partire dai Suoi documenti comincia sempre dallo stesso lavoro ingrato: andarli a cercare, convertirli, estrarne il testo, indovinarne la struttura. Su uno spazio collaborativo aziendale, questa fase occupa l'essenziale del progetto, e produce una copia che si desincronizza il giorno dopo.
Con dei file di testo, questa fase non esiste. Il contenuto è già testo, la struttura è già segnata dai titoli, e l'aggiornamento è il file stesso. Un sistema di ricerca documentale legge la cartella, nient'altro.
Il versionamento viene in più. Una cartella di file di testo si mette sotto gestione di versioni, il che dà due cose rare: lo storico di chi ha scritto che cosa e quando, e soprattutto la possibilità di trattare solo ciò che è cambiato. Su un corpus che vive, ritrattare unicamente le differenze anziché l'insieme è la differenza tra un trattamento quotidiano e un trattamento mensile.
Il grafo è posato a mano, non indovinato
È la proprietà più sottovalutata. In questi strumenti, una nota ne cita un'altra tramite un collegamento esplicito. Su un archivio di lavoro tenuto correttamente, la densità che constatiamo è dell'ordine di cinque collegamenti per nota, con quasi nove note su dieci collegate ad almeno un'altra.
Questi collegamenti sono un'informazione che nessuno ha bisogno di ricostituire. Un sistema di ricerca documentale classico avvicina i documenti per somiglianza statistica, il che funziona male non appena due testi parlano della stessa cosa con parole diverse, oppure due testi impiegano le stesse parole per cose diverse. Un collegamento posato dalla persona che ha scritto la nota dice qualcosa che la somiglianza non dirà mai: che quelle due note hanno un rapporto, e quale.
In concreto, questo consente una ricerca in due tempi: trovare la nota più pertinente, poi seguirne i collegamenti per riportarne il vicinato. Il risultato è più giusto e nettamente meno voluminoso di una ricerca per similarità che rastrella largo per non perdere nulla.
Il costo vero non è l'archiviazione, è il contesto
È la domanda che decide la fattibilità di un progetto, ed è quasi sempre posta al contrario. Archiviare delle note non costa nulla. Ciò che costa è quello che si invia al modello a ogni domanda.
| Ciò che si invia per rispondere a una domanda | Token |
|---|---|
| Una nota ben suddivisa, valore mediano | ≈ 1.200 |
| Tre note mirate dalla ricerca | ≈ 3.600 |
| L'intero corpus, su un archivio reale | ×71 |
Settantuno volte. E il punto importante non è la spesa: è che la versione cara è anche la meno affidabile. La capacità di un modello di sfruttare un'informazione si degrada a seconda della posizione di quell'informazione in un contesto carico, e ciò che si trova a metà di un insieme molto lungo viene utilizzato nettamente peggio di ciò che si trova alle estremità. Inviare tutto costa di più e risponde peggio.
È per questa ragione che l'argomento commerciale della finestra di contesto molto ampia va accolto con diffidenza. Vende una caratteristica del fornitore di modelli come se fosse una proprietà del sistema, mentre la vera questione è la qualità della selezione a monte. Sviluppiamo questo punto nella nostra nota sull'IA limitata.
Il formato si paga, a contenuto identico
Anche la marcatura conta. Abbiamo preso una delle nostre pagine pubblicate e contato tre volte la stessa cosa: la pagina così come viene servita, il suo articolo da solo con i suoi tag, e il testo nudo.
| Lo stesso contenuto | Token |
|---|---|
| La pagina completa, così come servita | 4.388 |
| L'articolo da solo, tag compresi | 2.644 |
| Il testo nudo | 2.012 |
La pagina intera costa più del doppio del testo che trasporta. Questo sovraccosto è marcatura, navigazione e metadati, vale a dire rumore per un modello. Su un documento per ufficio o su un export di spazio collaborativo, la proporzione è spesso peggiore, e nessuno la guarda.
Il Markdown si colloca all'estremo opposto: conserva la struttura utile, titoli, elenchi, enfasi, con una marcatura ridotta a qualche carattere. È il formato che trasporta più senso per token.
Che cosa questo impone a chi scrive
Un archivio ben tenuto non si decreta. Bastano tre discipline, e sono quelle che rendono poi efficace la ricerca documentale.
Una nota tratta un argomento e uno solo. È ciò che permette di riportarla intera senza trascinarsi dietro del fuori tema, e ciò che evita di doverla suddividere artificialmente più tardi. Il titolo annuncia ciò che la nota contiene, non la categoria a cui appartiene: è spesso il titolo a decidere che una nota verrà trovata. E i collegamenti si posano mentre si scrive, non in una sessione di riordino che non avviene mai.
Una quarta pratica fa più differenza delle altre tre messe insieme: tenere una nota indice che dia in una riga il contenuto di ciascuna delle altre. È lei che rende possibile la prima cernita senza leggere nient'altro, per un costo di qualche centinaio di token.
Che cosa questa scelta non fa
Un metodo che non espone alcun limite non è stato messo alla prova. Questo ha quattro inconvenienti, e contano.
Una cartella di file non è un sistema multiutente. Non ci sono diritti fini per documento, non c'è modifica simultanea confortevole, non c'è pista di audit nel senso di un sistema di gestione documentale. Per un corpus che deve essere condiviso da un'intera organizzazione con abilitazioni differenziate, non è lo strumento giusto, e occorre assumersi un'architettura diversa.
La qualità del grafo dipende interamente dalla disciplina di chi scrive. Una densità di cinque collegamenti per nota non è una proprietà del software, è un'abitudine coltivata. Un archivio trascurato non offre nessuno dei vantaggi descritti sopra.
Il Markdown rende male le tabelle complesse e i documenti con impaginazione vincolata. Una convenzione, un contratto o un rapporto formattato restano documenti per ufficio, e vanno trattati come tali. Infine i file su una postazione sono salvati solo se qualcuno li salva, il che è un'ovvietà fino al giorno in cui il disco si ferma.
Questi limiti delimitano un uso più che squalificarlo: una base di conoscenza di lavoro, tenuta da una squadra ristretta, destinata a essere interrogata. È esattamente il caso in cui la differenza di consumo misurata più sopra decide se un progetto è fattibile o no.
Sul degrado dello sfruttamento di un'informazione a seconda della sua posizione in un contesto carico, si vedano i lavori pubblicati con il nome di «lost in the middle» (Liang e coll.).