Ein Plausibilitätstest an einem einzelnen Beispiel zeigt, dass ein Werkzeug funktionieren kann. Ob es im Alltag trägt, zeigt erst ein echter Lauf. Genau den hat der Redakteur mit dem neuen Suchwerkzeug absolviert. Das Ergebnis enthielt zwei Überraschungen: einen plausibel wirkenden Themencluster, den das Werkzeug verwarf, und eine Zahl, die die schöne Demo relativierte.
Der Testlauf
Seit dem letzten Lauf waren keine neuen Notizen hinzugekommen. Also nahm der Redakteur die 140 Eingangsnotizen, die noch nie von einem Lauf erfasst worden waren: ein alter Rest aus der Zeit des Umzugs von Notion. Den Abgleich mit Bestehendem erledigte er dabei ausschließlich über das Werkzeug, nicht mehr durch Lesen der Volltexte.
Ein Cluster, der nicht bestand
Ein Cluster ist eine Gruppe thematisch zusammengehörender Notizen, die der Redakteur als Vorschlag bündelt. Im Lauf fiel eine Gruppe von vier Notizen mit Gaming-Bezug auf. Nach Tags und Titeln wirkte sie stimmig. Die Kohärenzprüfung über die Ähnlichkeitswerte zeigte etwas anderes: Nur zwei der vier Notizen hingen inhaltlich zusammen (Ähnlichkeit 0,83), zu den beiden anderen lag der Wert nur zwischen 0,35 und 0,41. Der Redakteur hat den Cluster verworfen, statt ihn zusammenzuzwingen. Damit kam die Regel "kein künstliches Rauschen" erstmals real zur Anwendung. Genau diesen Fehler, Notizen nach Etikett statt nach Inhalt zu gruppieren, hätte ein Abgleich per Tags und Titeln vermutlich durchgewinkt.
Insgesamt entstanden vier neue Cluster. Zu einem bereits offenen Thema fand das Werkzeug eine passende Ergänzung (Ähnlichkeit 0,824), sodass eine Doppelung vermieden wurde. Außerdem tauchten mehrere Duplikat-Kandidaten auf. Von 140 Notizen wurden 23 verarbeitet, 117 blieben bewusst liegen, weil kein erkennbares Muster vorlag. Ein direkter Vergleich mit der alten Methode ist nicht möglich, denn eine parallele Runde per Volltext gab es nicht. Die beiden Fälle zeigen aber, wo das Werkzeug den Unterschied macht.
Die unbequeme Beobachtung
Beim Durchsehen fiel etwas anderes auf: Fast alle 140 Notizen bestanden nur aus Titel und Link, ohne erfassten Inhalt. Von gut 30 gesichteten Notizen hatte eine einzige echten Text oder ein Transkript. War das ein Sonderfall des alten Backlogs oder der Normalfall? Ein Scan über alle 1.665 Eingangsnotizen sollte es klären. Als ausreichend zählte eine Notiz, wenn sie ein Transkript enthielt oder mehr als 150 Zeichen eigenen Text.
Das Ergebnis: 72,6 Prozent, also 1.208 von 1.665 Notizen, hatten keinen ausreichenden Inhalt. Der Testbatch war der Normalfall. Es betraf sogar Notizen, die schon in früheren Läufen geclustert worden waren. Sie waren damit allein auf Basis des Titels eingeordnet worden. Das ist kein Fehler des neuen Werkzeugs, sondern eine Eigenschaft des Bestands, die vorher nie jemand gemessen hatte. Für eine Suche über Bedeutung ist sie trotzdem gewichtig: Ein Embedding aus einem Titel ist ein deutlich schwächeres Signal als eines aus dem vollen Text.
Die Reaktion
Für Artikel und Bookmarks entstand ein Web-Crawl-Skript, das den Inhalt der verlinkten Seiten nachträgt. LinkedIn-Notizen sitzen hinter einer Login-Wand und werden von Hand nacherfasst. Das Skript für YouTube-Transkripte, das ich in der Serie zu den Erfassungswegen beschrieben habe, läuft nun über den gesamten Bestand statt nur über drei Themenfelder. Die Embeddings habe ich bewusst noch nicht neu berechnet. Solange die Crawls laufen, würde das nur mit schwachen Titel-Werten weiterarbeiten. Dank der Prüfsummen aus dem Ingestion-Service ist der Nachlauf später billig, weil nur die geänderten Notizen neu anstehen.
Fazit
Das Werkzeug hat im ersten Praxistest gezeigt, was es kann: Es verwarf einen Cluster, der nur nach Etikett stimmte, und fand die Ergänzung zu einem offenen Thema. Zugleich hat es unbeabsichtigt die größte Schwachstelle des Systems sichtbar gemacht. Ein Suchsystem ist nur so gut wie der Text, den es kennt.
Ausblick
Im nächsten Teil geht es um die Zahl nach dem Nachtragen: Wie viel hat sich in wenigen Tagen verändert, und was ändert die Suche gegenüber dem bisherigen Lesen nach Gefühl tatsächlich? Auch ein zweites Grundproblem bleibt offen: wie mit sehr langen Texten umzugehen ist, die sich nicht mit einer einzelnen Zahlenreihe erfassen lassen.