Ein Blick in die Plattform
Wie ein KI-Agent eine neue Fähigkeit lernt - und hinter sich aufräumt
Ein Agent, der sich nur Fakten merkt, erarbeitet sich das Vorgehen jedes Mal neu. Olano-Agenten schreiben das Vorgehen auf. Dieser Text erklärt die Technik dahinter: wie wiederkehrende Arbeit zu einer wiederverwendbaren, schriftlichen Prozedur wird, wie ein Agent eine Fähigkeit verbessert, die er nicht selbst geschrieben hat, ohne sie je zu überschreiben, wie eine gelernte Kopie den Tag überlebt, an dem das Original darunter aktualisiert wird - und warum nichts davon das System, das es verbessern soll, unbemerkt verschlechtern kann.
Das Gedächtnis sagt, was wahr ist. Fähigkeiten sagen, wie gearbeitet wird.
Die meisten Gespräche über KI-Gedächtnis hören bei Fakten auf, und Fakten sind es wert, behalten zu werden: Ihre Preise, Ihre Eskalationsregeln, wer der schwierige Kunde ist. Um genau diesen Aufbau geht es in Wie sich KI-Agenten erinnern. Das ist wirklich nützlich - und trotzdem nicht dasselbe wie Kompetenz.
Kompetenz ist prozedural. Der Montagsbericht wird in einer bestimmten Reihenfolge aus bestimmten Quellen mit bestimmten Vorbehalten zusammengestellt. Die Rückerstattungsanfrage wird gegen drei Dinge geprüft, bevor irgendjemand antwortet. Die vierteljährliche Lieferantenprüfung zieht immer dieselben sechs Kennzahlen. Ein Agent mit perfekten Fakten und ohne Prozedur erledigt jede dieser Aufgaben jedes Mal ein wenig anders - und genau diese Schwankung fällt Ihrem Team auf.
Deshalb führen Olano-Agenten neben dem Gedächtnis eine zweite Art von Artefakt: eine Fähigkeit. Eine Fähigkeit ist ein kleiner Ordner mit einer SKILL.md-Datei darin - ein Name, eine einzeilige Beschreibung, ein Auslöser, der sagt, wann man danach greift, und nummerierte Schritte. Manche Fähigkeiten kommen mit der Plattform. Manche stammen aus einem Fähigkeitenpaket oder einem Marktplatz. Manche schreiben Sie selbst. Und manche schreibt der Agent für sich selbst, aus Arbeit, die er tatsächlich getan hat.
Um diese letzte Kategorie geht es in diesem Artikel.
Woher eine gelernte Fähigkeit kommt
Jeder Zug eines Agenten wird an ein Protokoll angehängt. Ein Hintergrunddurchlauf liest diese Protokolle in einem Rhythmus - stündlich bei der aktivsten Taktung, alle vier Stunden bei der entspanntesten - und er liest nur das, was er noch nicht gelesen hat, nachgehalten über einen Byte-Offset pro Protokoll. Nichts wird erneut ausgewertet, und nichts wird übersprungen, weil eine Datei zwischen zwei Durchläufen gewachsen ist.
Von da an ist der Durchlauf bewusst schwer auszulösen:
- Bei weniger als vier neuen Zügen passiert nichts. Die Offsets werden trotzdem festgeschrieben, damit sich diese Züge nicht anstauen und ein späterer Durchlauf zu viel hineinliest.
- Er läuft auf der Stufe für tiefes Schlussfolgern - oder gar nicht. Es gibt kein billiges Ersatzmodell. Jeder Agent hat ein Tageslimit für tiefe Durchläufe - grob sechs, zwölf oder vierundzwanzig, je nach Taktungsvorgabe - und wenn das Limit oder das Ausgabenbudget erschöpft ist, wird der Zyklus übersprungen und beim nächsten Mal erneut versucht, während seine Offsets offen bleiben. Eine verschlechterte Auswertung ist schlimmer als gar keine: Sie erzeugt selbstbewusste, falsche Prozeduren.
- Er tritt zurück, solange das Gedächtnis neu geschrieben wird. Der Durchlauf zur Gedächtniskonsolidierung setzt eine Sperre; der Destillierer sieht sie und hält sich zurück, statt in eine Datei zu schreiben, die gerade vollständig neu geschrieben wird.
Läuft er, landen zuerst Fakten im Gedächtnis. Ist das Lernen von Fähigkeiten aktiviert, gehen dieselben Züge anschließend in einen zweiten Durchlauf.
Der Kundschafter liest die Bibliothek, bevor er das Protokoll liest
Das ist der Teil, der verhindert, dass eine gelernte Bibliothek zur Mülldeponie wird. Dem Fähigkeiten-Kundschafter wird nicht einfach ein Gespräch vorgelegt mit der Frage "was hast du gelernt?". Ihm wird ein Gespräch vorgelegt und dazu ein Verzeichnis jeder Fähigkeit, die der Agent bereits hat - einschließlich verwalteter und fremder Fähigkeiten, die außerhalb des eigenen Arbeitsbereichs liegen und die seine Dateiwerkzeuge von sich aus nicht sehen können - und die Frage lautet, was, wenn überhaupt, fehlt.
Jeder Kandidat, den er zurückgibt, trägt eine Aktion, und zwei der drei Aktionen erzeugen überhaupt keine neue Fähigkeit:
- skip - die Fähigkeit ist bereits abgedeckt. Das ist das häufigste Ergebnis, und es ist ein Erfolg.
- update - eine vorhandene Fähigkeit deckt es fast ab und sollte geschärft werden. Der Kandidat benennt das Ziel.
- create - wirklich neu. Nur dann wird eine Fähigkeit geschrieben.
Eine neue Fähigkeit durchläuft anschließend einen zweiten Prüfdurchlauf, der nach beinahe gleichlautenden Namen sucht, bei einem Treffer abbricht und eine sauber strukturierte SKILL.md mit korrektem Frontmatter schreibt. Kann dieser Durchlauf nicht abschließen, schreibt das System den Kandidaten direkt, statt ihn zu verlieren.
Eine Fähigkeit verbessern, die er nicht geschrieben hat
Eine Verbesserung ist der interessante Fall, denn die naheliegende Umsetzung ist die falsche.
Eine Fähigkeit, die Sie installiert haben, ist kein einzelnes Dokument. Sie kann ein mehrteiliges Handbuch sein: eine SKILL.md plus Skripte, Referenztabellen, Formulare, Vorlagen. Und sie gehört der Quelle - wird das Paket, aus dem sie stammt, aktualisiert, wird dieser Ordner komplett ersetzt. Ein Agent, der eine solche Fähigkeit "verbessert", indem er sie an Ort und Stelle neu schreibt, hat also zwei Fehler auf einmal gemacht: Er hat ein Handbuch durch eine Zusammenfassung gepresst, und er hat seine Verbesserung genau in den Weg der nächsten Aktualisierung gelegt, die sie stillschweigend löschen wird.
Olano legt stattdessen eine Abzweigung an. Beim ersten Mal, wenn ein Agent eine fremde Fähigkeit verbessert:
- Der gesamte Ordner wird Byte für Byte in die gelernte Bibliothek des Agenten kopiert, wobei interne Pfadverweise so umgeschrieben werden, dass die Kopie am neuen Ort funktioniert.
- Die Kopie übernimmt den exakten Namen des Originals, sodass sie das Original überlagert statt es zu ersetzen, wenn der Agent seine Fähigkeiten lädt. Die Originaldatei wird auf der Festplatte nie angefasst.
- Daneben wird ein Herkunftsnachweis geschrieben: ein Fingerabdruck pro Datei der Quelle zum Zeitpunkt der Abzweigung, ein Fingerabdruck pro Datei der Kopie zum selben Zeitpunkt und die Abschnittsstruktur der ursprünglichen SKILL.md-Datei.
- Eine unberührte Momentaufnahme des Ausgangszustands wird getrennt aufbewahrt und dient später als Zusammenführungsbasis.
Jede weitere Verbesserung wird ergänzend auf die Kopie angewendet. Daraus folgen zwei Eigenschaften, die ein Entwurf mit Überschreiben an Ort und Stelle nicht haben kann: "Hat diese Verbesserung etwas verloren?" wird zu einer prüfbaren Frage gegen eine festgehaltene Ausgangslage statt zu einem unscharfen Vergleich zweier unverwandter Dokumente, und "Hat sich das Original an der Quelle geändert?" bleibt für immer beantwortbar.
Die Bewahrungsprüfung
Der Fehlerfall, den bei selbstverändernden Systemen alle fürchten, ist die allmähliche, stille Verschlechterung: jeder Durchlauf etwas kürzer, etwas blasser, bis aus dem, was einmal funktionierte, ein Absatz Gemeinplätze geworden ist. Zu versprechen, dass das nicht passiert, ist keine technische Antwort.
Deshalb wird eine gelernte Kopie bei jedem Laden der Fähigkeiten gegen ihren eigenen festgehaltenen Ausgangszustand geprüft. Sie fällt durch, wenn:
- eine Datei, die bei der Abzweigung vorhanden war, jetzt fehlt;
- eine Textdatei unter die Hälfte ihrer ursprünglichen Größe geschrumpft ist (Dateien unter etwa einem halben Kilobyte sind ausgenommen, da kleine Dateien ihre Größe berechtigterweise stark ändern);
- die SKILL.md-Datei mehr als ein Drittel der Abschnittsüberschriften des Originals verloren hat.
Eine Kopie, die durchfällt, wird unter Quarantäne gestellt - sie überlagert nicht mehr, und das Original greift wieder. Der Agent verliert eine Verbesserung; er verliert keine funktionierende Fähigkeit. Und die Prüfung gilt bewusst nur für maschinell geschriebene Kopien: Eine gelernte Fähigkeit, die ein Mensch von Hand geschrieben hat, kommt nie in Quarantäne, denn eine bewusste Überschreibung soll maßgeblich bleiben, auch wenn sie kürzer ist.
Wenn sich das Original darunter ändert
Irgendwann wird die Fähigkeit an der Quelle aktualisiert - ein Paket-Update, eine Marktplatz-Aktualisierung, eine Änderung durch Ihr Team. Jetzt haben sich zwei Linien bewegt, und der Herkunftsnachweis macht eine echte Drei-Wege-Zusammenführung möglich statt einer Vermutung. Aufgelöst wird pro Datei, und zuerst deterministisch: Ein Modell wird nur dort hinzugezogen, wo es keine deterministische Antwort gibt.
| Das Original | Die gelernte Kopie | Was passiert |
|---|---|---|
| Unverändert | Beliebig | Die gelernte Kopie bleibt. Nichts zu tun. |
| Geändert | Unberührt | Die neue Fassung von der Quelle übernehmen, ihre internen Pfadverweise umschreiben und den Herkunftsnachweis auf den neuen Quell-Fingerabdruck setzen. |
| Gelöscht | Unberührt | Auch aus der gelernten Kopie löschen. Die Quelle hat sie aus einem Grund entfernt, und lokal spricht nichts dagegen. |
| Gelöscht | Geändert | Die gelernte Kopie behalten und einen Konflikthinweis anhängen. Jemand sollte sich das ansehen; in der Zwischenzeit geht nichts verloren. |
| Geändert | Geändert - Text | Drei-Wege-Zusammenführung gegen die festgehaltene Basis. Eine saubere Zusammenführung wird übernommen. Ein echter Konflikt behält die gelernte Kopie und geht an den Bibliotheksdurchlauf zur inhaltlichen Klärung. |
| Geändert | Geändert - Skript oder Binärdatei | Die gelernte Kopie behalten und markieren. Code wird nie automatisch zusammengeführt: Ein still kaputtes Skript ist schlimmer als ein veraltetes. |
Danach werden die Fingerabdrücke und die Basis-Momentaufnahme auf den zusammengeführten Stand gebracht. Genau das lässt die Schleife konvergieren: Dieselbe Abweichung wird nie erneut gemeldet, und die Bewahrungsprüfung arbeitet weiter gegen die neue Ausgangslage statt gegen eine uralte. Eine Kopie, die die Prüfung derzeit nicht besteht, wird von der Zusammenführung ganz ausgelassen - eine verschlechterte Kopie erneut zusammenzuführen hieße, sie wieder salonfähig zu machen.
Ein Durchlauf über die ganze Bibliothek
Fähigkeiten einzeln zu prüfen ist nicht dasselbe, wie eine Bibliothek zusammenhängend zu halten. Ein eigener Durchlauf liest deshalb nach eigenem Zeitplan jede Fähigkeit des Agenten und behandelt die Sammlung als Arbeitseinheit: Er führt Duplikate und Beinahe-Duplikate zu einer maßgeblichen Fassung zusammen - bester Name, klarster Auslöser, Vereinigung der Schritte -, löscht die weggeführten Ordner, führt jede Kopie neu zusammen, deren Original abgedriftet ist, und verbessert, was übrig bleibt.
Die Grenze wird erzwungen, nicht empfohlen: Originale und verwaltete Fähigkeiten sind für diesen Durchlauf schreibgeschützt. Er darf nur innerhalb der gelernten Bibliothek bearbeiten, zusammenführen und löschen. Bevor er beginnt, wird von jeder Datei, die er anfassen könnte, eine Momentaufnahme gemacht, und wenn er fertig ist, meldet er seine Änderungen mit einem einzigen Rückgängig-Knopf.
Dieselbe Behandlung für den Arbeitsbereich selbst
Die eigene Konfiguration eines Agenten ist ebenfalls Fließtext, und über Monate schrittweise geschriebener Text häuft sich auf dieselbe Weise an: dieselbe Anweisung an drei Stellen in drei Formulierungen, eine Vorliebe in der falschen Datei notiert, eine Notiz in elf aufeinanderfolgenden Tagesprotokollen wiederholt und gelegentlich zwei Anweisungen, die sich leise widersprechen.
Dafür gibt es einen Durchlauf zur Konsolidierung des Arbeitsbereichs. Er liest die Dateien für Identität, Verhalten, Anweisungen und Langzeitgedächtnis des Agenten sowie die Tagesprotokolle der letzten beiden Wochen und schreibt sie an Ort und Stelle neu: umformulierte Duplikate zusammenführen, Widersprüche entfernen, Zusammengehöriges unter klaren Überschriften gruppieren und Inhalte in die Datei verschieben, in die sie gehören. Die Tagesprotokolle werden am striktesten entdoppelt, weil sich dort Wiederholung am schnellsten sammelt.
Die Anweisung, unter der er läuft, ist einen Satz lang und trägt die ganze Last: Bewahre die Stimme des Agenten und jede einzelne Anweisung; fasse zusammen, lösche nie. Wie beim Bibliotheksdurchlauf wird von jeder Zieldatei zuerst eine Momentaufnahme gemacht, und das Ergebnis wird mit einem Rückgängig-Knopf gemeldet.
Zwei Regeln, und der Unterschied zählt
Nicht alles in dieser Schleife wird gleich behandelt, und die Trennung ist bewusst gewählt, nicht bequem.
- Zu ändern, was einem Agenten aufgetragen wird, ist reiner Vorschlag. The pass that reviews recent work and concludes an agent's instructions should be sharper does not edit those instructions. It writes grounded proposals into a review queue, and they wait - even with Fully Autonomous on, which otherwise lets new skills, memory and tidy-ups apply on their own. Nothing rewrites an agent's instructions because a background job thought it should, unless a deployment owner has explicitly lifted that hold for the agent.
- Verlustfreies Aufräumen greift direkt, mit Momentaufnahme und Rückgängig-Knopf. Gedächtnis entdoppeln, zwei identische gelernte Fähigkeiten zusammenführen, eine wiederholte Notiz zusammenfassen - das ändert nicht, was der Agent tut, sondern nur, wie ordentlich es aufgeschrieben ist. Für jeden dieser Schritte einen menschlichen Klick zu verlangen, würde Ihr Team darauf trainieren, ungelesen zuzustimmen - das schlechtestmögliche Ergebnis für die Liste, auf die es wirklich ankommt. Also greifen sie direkt, nach einer Momentaufnahme, und jeder Lauf meldet seine Änderungen mit Rückgängig-Knopf.
Alles davon ist abschaltbar. Jedes Verhalten - Destillation, Lernen von Fähigkeiten, Pflege der Bibliothek, Konsolidierung des Arbeitsbereichs, Konsolidierung des Gedächtnisses - ist ein eigener Schalter, für die gesamte Bereitstellung setzbar und pro Agent in beide Richtungen überschreibbar, sodass "überall aus, außer bei diesem einen Agenten" eine echte Einstellung ist. Darüber sitzt ein Hauptschalter und eine getrennte Wahl zwischen Laufen nach Zeitplan und Laufen nur auf Zuruf. Die Taktungsvorgaben - entspannt, ausgewogen, forsch - verschieben Zeitpläne und Tageslimits für tiefes Schlussfolgern gemeinsam, und sie unterliegen denselben harten Ausgabenkontrollen, die alles andere in der Bereitstellung steuern.
Wie eine vollständige Schleife aussieht
Der Zinseszins ist langsam und konkret. Der Bericht, den Ihr Betriebsagent drei Wochen in Folge von Hand erstellt hat, liegt in der vierten als schriftliche Prozedur vor. Die Paket-Fähigkeit, die für Ihre Branche fast passte, trägt Ihre Korrektur und nimmt trotzdem die nächste Aktualisierung des Anbieters auf, statt von ihr platt gemacht zu werden. Die Anweisungsdatei, die auf vier Seiten sich überschneidender Hinweise angewachsen war, sind zwei Seiten ohne Überschneidung - und jeder Satz, der nur in der gelöschten Fassung stand, steht weiterhin in der behaltenen.
Was das nicht ist
Es werden keine Modellgewichte trainiert, feinabgestimmt oder angepasst. Diese gesamte Schleife arbeitet eine Ebene über dem Modell, an Artefakten in einfacher Sprache innerhalb Ihrer eigenen isolierten Bereitstellung: Fähigkeiten, Gedächtniseinträge, Anweisungsvorschläge. Das sind Dateien. Ihr Team kann sie lesen, von Hand bearbeiten, freigeben, zurückrollen und nachvollziehen, wer wann was geändert hat.
Das ist keine Einschränkung, um die wir herumarbeiten. Es ist der Grund, warum die Schleife etwas ist, das Sie steuern können, statt etwas, dem Sie vertrauen müssen - und aus demselben Grund gilt: das Modell darunter lässt sich austauschen, ohne dass der Agent verliert, was er gelernt hat.
Weiterlesen
Der Rest der Reihe "Die Plattform von innen" und die Handbuchkapitel, die tiefer gehen.
Ein Blick in Olano Cortex
Die größere Verbesserungsmaschine, zu der diese Schleife gehört: fünf Zyklen, eine Taktung, die Sie bestimmen, und Ihre Freigabe für jede Selbstbearbeitung.
Wie sich KI-Agenten erinnern
Die andere Hälfte der Geschichte: Gesprächsgedächtnis, destilliertes Langzeitgedächtnis und Ihre Dokumente als Grundwahrheit.
Cortex, im Handbuch
Die Einstellungen selbst - Funktionsschalter, Taktungsvorgaben, Übersteuerungen pro Agent und die Prüfliste.
Anfragen automatisieren - mit menschlicher Freigabe
Vertrauensstufen 0-4 und Freigaben pro Kategorie - die Freigabe-Architektur, in die sich die Vorschlagsliste einklinkt.
FAQ
Was ist eine Fähigkeit, und wie unterscheidet sie sich vom Gedächtnis?
Das Gedächtnis hält fest, was über Ihr Unternehmen wahr ist - Preise, Personen, Entscheidungen, Vorlieben. Eine Fähigkeit hält fest, wie ein Stück Arbeit erledigt wird: eine kurze schriftliche Prozedur mit Namen, Beschreibung, einem Auslöser, der sagt, wann man danach greift, und nummerierten Schritten. Das Gedächtnis verhindert, dass der Agent Ihnen dieselbe Frage zweimal stellt. Fähigkeiten verhindern, dass er dieselbe Prozedur zweimal neu erfindet und jedes Mal etwas anders ausführt.
Schreibt der Agent die Fähigkeiten um, die Sie ihm gegeben haben?
Nein. Fähigkeiten von Ihnen, aus einem Fähigkeitenpaket oder von einem Marktplatz sind schreibgeschützte Originale und werden nie bearbeitet oder gelöscht. Um eine zu verbessern, kopiert der Agent den gesamten Fähigkeitenordner in seine gelernte Bibliothek und bearbeitet die Kopie, die den Namen des Originals übernimmt und deshalb Vorrang hat, wenn der Agent seine Fähigkeiten lädt. Die Originaldatei bleibt auf der Festplatte unberührt - genau das macht eine spätere Aktualisierung von der Quelle zusammenführbar statt verloren.
Was verhindert, dass eine gelernte Fähigkeit zu einer schlechteren Zusammenfassung verkümmert?
Eine Bewahrungsprüfung, die beim Laden der Fähigkeiten läuft. Eine gelernte Kopie wird gegen ihren eigenen festgehaltenen Ausgangszustand geprüft: Ist eine Textdatei unter die Hälfte ihrer ursprünglichen Größe geschrumpft, fehlt mehr als ein Drittel der ursprünglichen Abschnittsüberschriften, oder fehlt eine Datei, die am Anfang vorhanden war, kommt die Kopie in Quarantäne und das Original greift wieder. Das ist eine strukturelle Prüfung, kein Versprechen - und von Hand geschriebene Kopien sind ausgenommen, weil bewusste Überschreibungen maßgeblich bleiben.
Was passiert, wenn die ursprüngliche Fähigkeit später aktualisiert wird?
Eine Drei-Wege-Zusammenführung, pro Datei, gegen eine Momentaufnahme des Zustands zum Zeitpunkt der Abzweigung. Dateien, die die Quelle geändert und die gelernte Kopie nie angefasst hat, werden von der Quelle übernommen. Dateien, die die gelernte Kopie geändert hat und die Quelle nicht, bleiben. Wo sich beide geändert haben, wird Text gegen die gemeinsame Basis zusammengeführt, und ein echter Konflikt geht zur Klärung an den Bibliotheksdurchlauf. Skripte und Binärdateien werden nie automatisch zusammengeführt: Die gelernte Kopie bleibt und wird markiert, denn ein still kaputtes Skript ist schlimmer als ein veraltetes.
Wird irgendetwas geändert, ohne mich zu fragen?
Das hängt davon ab, was geändert wird, und die Trennung ist bewusst gewählt. Alles, was ändert, was einem Agenten aufgetragen ist - seine Anweisungen, sein Verhalten -, wird als Vorschlag in eine Prüfliste geschrieben und nie von selbst angewendet. Verlustfreies Aufräumen - Gedächtnis entdoppeln, doppelte gelernte Fähigkeiten zusammenführen, wiederholte Notizen zusammenfassen - darf direkt greifen, aber nur nach einer Momentaufnahme, und jeder dieser Läufe meldet seine Änderungen mit einem Rückgängig-Knopf. Sie können jedes dieser Verhalten außerdem einzeln abschalten, für die gesamte Bereitstellung oder für einen einzelnen Agenten.
Wird damit ein KI-Modell auf meinen Daten nachtrainiert?
Nein. Es werden keine Modellgewichte trainiert oder feinabgestimmt. Alles, was diese Schleife erzeugt, ist eine einfache Markdown-Datei in Ihrer eigenen Bereitstellung: eine Fähigkeit, ein Gedächtniseintrag, ein Änderungsvorschlag für eine Anweisung. Ihr Team kann sie lesen, vergleichen, von Hand bearbeiten, freigeben und zurückrollen. Genau diese Lesbarkeit ist der Punkt - sie macht aus einer Verbesserungsschleife etwas, das Sie steuern können, statt etwas, dem Sie vertrauen müssen.
Ein System einsetzen, das aufschreibt, was es lernt
Der Zinseszins zählt nur, wenn die Arbeit darunter echt ist. Buchen Sie ein Beratungsgespräch - wir bilden den Arbeitsablauf ab, kalkulieren ihn und bauen erst, wenn Sie zustimmen.