moritz conjé
Projektmanagement
Kommunikation & Konzeption
T-Shaped Professional

Notizblog

Homelab: Beiträge rund um Aufbau und Betrieb meines eigenen Homelabs:
von Hardware und Netzwerk bis zu selbst gehosteten Diensten und smarter Haussteuerung.
Eigene Lösungen statt fertiger Anbieter, mit allem Basteln und Lernen, das dazugehört.

Eine eigene Statuszeile fürs Terminal: mehr Überblick bei der Arbeit mit Claude Code
Wer täglich mit einer KI im Terminal arbeitet, kennt das Problem: Wie ausgelastet die laufende Sitzung gerade ist, wie nah man an ein Nutzungslimit kommt oder was sie bereits gekostet hat, bleibt normalerweise unsichtbar. Man merkt es meist erst, wen ...
Fähigkeiten ergänzen: passende Skills für die Rollen und Aufgaben finden
Ein KI-Assistent kann schon ohne Erweiterungen erstaunlich viel. Für ein konkretes Projekt reicht „erstaunlich viel" aber selten als Arbeitsweise. Beim Aufbau des Second Brain kamen zuletzt drei sehr unterschiedliche, eigenständige Projekte zusammen: ...
Wie Wissen ins Second Brain kommt: Web-Clipper, YouTube-Transkripte und Bücher
Der letzte Teil dieser Serie endete mit einer offenen Frage: Wie gut ein Redakteur Themen clustern kann, hängt direkt davon ab, was überhaupt an Input hereinkommt – und wie es dort ankommt. Der große Notion-Import hatte den bestehenden Wissensbestand ...
Arbeiten im Second Brain: Claude Remote auf LXC und der Zugriff aufs LLM-Wiki über TrueNAS
Das Rollenmodell aus den letzten Teilen dieser Serie beantwortet, wer im Second Brain mit welchen Rechten arbeitet. Offen blieb bislang eine ganz praktische Frage: Wo findet diese Arbeit eigentlich statt, wenn ich nicht am Schreibtisch-PC sitze? Das ...
Vom Konzept zum ersten echten Testlauf: das Übergabe-Artefakt-Schema in der Praxis
Der Second-Brain-Bibliothekar aus Beitrag 4 darf laut Rollenmodell keine Quellnotizen verändern – nur lesen. Das wirft sofort eine praktische Frage auf: Wie kommen seine Erkenntnisse dann überhaupt irgendwo an? Und wie bleibt nachvollziehbar, wenn de ...
Die fünfte Rolle: wie der Kurator (agt_kur) das Rollenmodell selbst korrigiert
Ein Rollenmodell zu entwerfen und mit genau diesem Entwurf gegen eine bereits getroffene, dokumentierte Entscheidung zu verstoßen, ohne es zu merken – das ist mir beim Ausarbeiten meiner fünften Rolle tatsächlich passiert. Aufgefallen ist der Widersp ...
Vier Rollen für ein Second Brain: wie ich Agenten-Verantwortlichkeiten definiert habe
Irgendwann habe ich nachgezählt: 1.638 Input-Notizen standen nur 36 tatsächlich verarbeiteten Notizen gegenüber – weniger als drei Prozent. Das Sammeln hatte in meinem Second Brain längst funktioniert, das Verarbeiten nicht. Die eigentliche Frage war ...
Wenn das Kanban-Board bricht: Grenzen des Task-Board-Plugins und der Weg zu Bases
Mit dem Prozessmodell stand fest, wie ich über mein Second Brain denken will. Für die tägliche Arbeit brauchte ich aber auch ein Werkzeug, das dieses Denken abbildet – ein Kanban-Board für Projekte und Aufgaben. Genau dort brach mir wenig später eine ...
Umfangreiche Ergänzung der Inhalte und Datenbank

Im letzten Teil stand eine unbequeme Zahl: 72,6 Prozent der Eingangsnotizen hatten keinen ausreichenden Inhalt. Wenige Tage später hieß es, die Lücke sei schon deutlich kleiner. Stimmt das, oder fühlt es sich nur so an? Dieser Teil prüft es nach, zieht die Konsequenz für die Suche und beschreibt den ersten Umzug des Stacks auf einen der NUCs. Außerdem gibt es eine Bilanz: Was hat sich durch das ganze Projekt gegenüber dem Lesen nach Gefühl tatsächlich verändert?

Nachmessen statt glauben

Statt der Behauptung zu vertrauen oder sie zu bezweifeln, habe ich exakt dieselbe Prüfregel noch einmal live gegen den aktuellen Bestand laufen lassen. Die dokumentierte Zahl vom ersten Scan zu zitieren, wäre keine Nachmessung gewesen. Dazu kam eine Stichprobe der neuen Treffer, um Fehltexte und Fehlermeldungen auszuschließen, die ein Web-Crawler statt echter Inhalte mitschleppen kann.

Das Ergebnis: Nur noch 23,5 Prozent der Notizen hatten keinen ausreichenden Inhalt, statt 72,6 Prozent. Von den Notizen, die sich verändert hatten, stammten 616 aus dem Web-Crawl und 228 aus den YouTube-Transkripten, ohne Überschneidung und ohne ungeklärte Fälle. Der Datenbestand war also schon viel weiter als die zuletzt dokumentierte Zahl. Nur die Datenbank wusste noch nichts davon, denn seit der Erstbefüllung hatte kein neuer Einleselauf stattgefunden.

Der Nachlauf kostet fast nichts

Hier zahlt sich die Prüfsumme aus dem Ingestion-Service aus. Der Lauf erkannte selbst, was sich geändert hatte: 12 neue Notizen, 841 aktualisierte, 899 unveränderte. Er dauerte rund zwei Minuten. Der Plausibilitätstest lieferte weiterhin den bekannten Spitzenreiter mit demselben Wert von 0,849, dazu jetzt mehr passende Treffer darunter. Mehr Text bedeutet bessere Trennschärfe. Bewusst habe ich nicht auf die vollen 100 Prozent gewartet, der Rest besteht überwiegend aus LinkedIn-Notizen, die nur von Hand nachzuziehen sind.

Um den Datenstand rechtzeitig fertigzustellen, habe ich für die letzten offenen YouTube-Videos außerdem die Pause zwischen den Abrufen deutlich verkürzt. Das erhöht das Risiko, von der Plattform gesperrt zu werden, und ich habe es bewusst in Kauf genommen.

Der erste Umzug: NUC 2 reicht

Parallel stand die Hardware-Frage aus dem Modellvergleich an: Reicht die vorhandene Flotte, oder braucht es einen Neukauf? Dank des schlanken nomic-embed-text reicht der Hauptserver NUC 2. Der gesamte Stack zog dorthin um, mit einem Snapshot der Datenbank als Transportmittel. Ein erneuter Plausibilitätstest lieferte 0,848 statt 0,849, praktisch identisch. Der Umzug verändert die Suchqualität also nicht, nur den Standort. Eine Anfrage dauert dort rund drei Sekunden, spürbar, aber für einen Werkzeugaufruf eines Agenten praktikabel. Der Gaming-PC ist damit aus dem produktiven System heraus.

Was das Projekt wirklich verändert hat

Der eigentliche Gewinn liegt nicht im Umzug, sondern im Vergleich mit dem Zustand vor VectorSearch:

  • Suchvorgehen, vorher: Der Redakteur las verarbeitete Notizen und offene Cluster selbst durch und verglich nach Gefühl. Das war eine Ermessensentscheidung beim Lesen, ohne messbare Ähnlichkeit.
  • Suchvorgehen, jetzt: Die Suche liefert Ähnlichkeitswerte. Das ermöglicht etwas, das vorher strukturell nicht ging: die Kohärenzprüfung. Der verworfene Gaming-Cluster ist das Beispiel. Es geht also nicht nur um Tempo, sondern um eine andere Fehlerklasse, die jetzt sichtbar wird. Die Kehrseite: Die Suche sieht nur, was das Ranking zurückgibt. Zufälliges Querlesen durch freies Stöbern fällt weg.
  • Datendichte, vorher: Es gab keinen eigenen Index und keine Messgröße. Was der Redakteur beim Lesen an Volltext fand, war Zufall.
  • Datendichte, jetzt: Ein abfragbarer Index mit rund 1.750 Notizen und einer ersten Vollständigkeits-Metrik. Sie ist ein Nebenprodukt des Projekts und machte überhaupt erst sichtbar, dass fast drei Viertel der Notizen anfangs nur Linksammlungen waren. Aktuell sind es 76,5 Prozent mit ausreichendem Inhalt.

Fazit

Die Ausgangsfrage war, ob sich die Lücke wirklich verkleinert hat. Sie ließ sich mit einer Messung beantworten, nicht mit einem Gefühl. Genau das ist der Kern des Projekts: von einer Ermessensentscheidung beim Lesen zu einer prüfbaren Ähnlichkeitsbewertung.

Ausblick

Ob NUC 2 die Endstation war, klärt sich in einem späteren Teil. Zuvor bleibt eine Frage offen, die bisher nur am Rand stand: Was passiert mit sehr langen Texten wie Büchern, wenn jede Notiz nur eine einzige Zahlenreihe bekommt? Dazu gibt es im nächsten Teil Zahlen, die überraschen.