2026-08-01T10:18:36.512Z

AI-Agent: Beförder Veränderungen, nicht Selbstbearbeiten Live

Befrieren Sie jede vorgeschlagene Verhaltensänderung, vergleichen Sie sie mit ihrem genauen Elternteil, schützen Sie Regressionsbudgets und halten Sie Autorität und Rückkehr außerhalb der Schreibschleife.

Ein sich selbst verbesserer AI Agent sollte sein Live Verhalten nicht neu schreiben und den Weiterentwicklungsschritt anrufen. Die sichere Standardregelung ist es, jeden vorgeschlagenen Anruf, Speicher, Abruf, Tool Policy oder Code Änderung als unzuverlässigen Release Kandidaten zu behandeln. Befrieren Sie den Kandidaten, vergleichen Sie ihn mit seinem genauen Elternteil auf Beweise, die er nicht bearbeiten kann, überprüfen Sie jede geschützte Metrik, beweisen Sie, wer ihn genehmigen kann, und halten Sie ein lösbares Rollback Ziel. Erst dann kann eine kleine, umkehrbare Veränderung in einen begrenzten Kanarienbären gelangen. Diese Regel erlaubt immer noch Verbesserungen. Es verändert die Einheit des Vertrauens. Feedback kann einen Kandidaten automatisch generieren; Aktivierung erfordert Beweise. Die Unterscheidung ist wichtig, weil die Selbstverbesserung mehr umfasst als nur Modellbildung. Nachdenken speichert verbale Rückmeldungen im episodischen Gedächtnis, so dass sich spätere Studien ohne Gewichts Update anders verhalten. Selbstreinigung wechselt Rückkopplung und Verfeinerung mit demselben Modell. Eine Routing Anforderung, eine abgerufene Lektion, ein Tool Allowlist oder ein schreibbares Skript können den nächsten Lauf genauso sicher verändern wie ein neuer Checkpoint. Ihr Wechselbuch muss jede dieser Oberflächen abdecken. Befrieren Sie den Kandidaten, bevor Sie ihn messen Beginnen wir mit zwei unveränderlichen Identitäten: dem aktiven Elternteil und dem Kandidaten. Eine nützliche Änderungsanzeige: Die Verdauung verhindert eine ruhige Bearbeitung zwischen Evaluierung und Kanarien. Die Mutteridentität verhindert, dass ein gegen agent v41 erzeugter Kandidat über ein nun aktives agent v42 befördert wird. Die Liste der Schreiboberflächen zeigt den echten Explosionsradius. Ein Vorschlag, der als memory lesson beschrieben wird, ist nicht so klein, wenn sein Prozess auch die Bewertungs oder Autoritätspolitik bearbeiten kann. Lassen Sie den Kandidaten nicht seine Halt out Fälle, Scoring Code, Annahme Schwellenwerte, Genehmigungsrichtlinien oder Rollback Geschichte schreiben. Das sind die Regel, das Schloss und der Notfall Ausgang. Ein Agent, der sie verändern kann, kann seine Punktzahl erhöhen, ohne die Aufgabe zu verbessern. Dies ist auch der Grund, warum eine Lerndatei, die nur als Ergänzung verwendet wird, Versionsverarbeitung verdient. Eine kurze Lektion kann die Abholung umleiten, die Eskalation unterdrücken oder die Wahl von Werkzeugen für die Verzerrung in jedem späteren Lauf verhindern. Nur das Gedächtnis verändert beschreibt den Speichermechanismus, nicht das Betriebsrisiko. Vergleichen Sie den genauen Elternteil und den Kandidaten auf geschlossenen Beweisen Ein absoluter Kandidatenwert ist ein schwacher Beweis. Führen Sie den Elternteil und den Kandidaten gegen die gleichen Fall IDs, Umgebungsversion, Werkzeug Fixtures, Zufallsrichtlinie und Ergebnis Verifier. Speichern Sie die Paare. Die Frage ist nicht, ob der Kandidat 0,86 Punkte erzielt hat? Es ist, was sich im Vergleich zum Elternteil geändert hat, in welchen Fällen und zu welchem Preis? Das OpenAI selbstentwickelndes Kochbuch zeigt eine praktische Schleife mit einer Basislinie, menschlichen oder modellen Feedback, Evaluations, einer Punktungsschwelle, einer erneuten Versuchsgrenze und einer aktualisierten Basislinie. Das ist eine nützliche Maschine für die Erzeugung und Messung von Kandidaten. Eine Entscheidung zur Förderung der Produktion benötigt eine strengere Grenze als eine Gesamtschwelle, da die Durchschnittswerte verbergen, welches Eigentum für den Gewinn bezahlt wurde. Nehmen wir an, dass der Erfolg der Aufgabe von 0.80 auf 0.89 steigt, während die Integrität des Werkzeugeffekts von 0.99 auf 0.96 fällt. Der Durchschnitt kann steigen. Die Änderung wird immer noch nicht durchgeführt, wenn doppelte oder fehlende äußere Wirkungen inakzeptabel sind. Erläutern Sie die Ziel und geschützten Metriken explizit: Metriken Anweisung Beförderungsregelung Erfolg der Aufgabe Höhere Der Bewerber muss sich um mindestens 0.03 verbessern Integrität der Werkzeugwirkung Höhere Nicht erlaubt Regression Genehmigungsrouting Höhere Die Regression darf 0.02 nicht überschreiten Kosten pro geprüften Ergebnis Nieder Die Zunahme darf 0.05 nicht überschreiten Verwenden Sie Metriken, die mit beobachtbaren Ergebnissen verbunden sind. Ein Befehl, der aus Null herausgegangen ist, ist kein Beweis dafür, dass ein Lieferwert existiert. Ein Tool Anruf in einer Spur ist kein Beweis dafür, dass sich das Ziel genau einmal geändert hat. Ein Modellrichter kann mit subjektiver Qualität helfen, sollte aber keine deterministische Datei, Datenbank, Erlaubnis oder Effektprüfung übertreffen. Das gesperrte Set sollte bekannte Fehler und gültige Wartezeiten enthalten. Andernfalls kann sich der Agent durch eine aggressivere Entwicklung verbessern: weniger Eskalationen, weniger Fragen, schnelleres Abwickeln und mehr falsche Nebenwirkungen. Zumindest eine außerhalb der Bandbreite eingeschlossene Maßnahme, die der Kandidat nicht direkt optimiert. Abgesonderte Vorschlagsbehörde von der Aktivierungsbehörde Wenn ein Agenten eine Änderung vorschlagen lässt, bedeutet das nicht, dass er die Autorität hat, sie zu aktivieren. Definition der Genehmigung nach Oberfläche und Explosionsradius. Eine kleine Änderung des Schnellroutings könnte unter einer vorab genehmigten Richtlinie in einen 20 Tasks Kanarien eintreten. Eine Rückholungs oder Werkzeugpolitikänderung erfordert möglicherweise einen benannten Menschen. Der Laufzeitcode, die Logik des Evaluators, der Anmeldebereich und irreversible Aktionen sollten außerhalb der automatischen Werbung bleiben. Übermäßige Richtlinien der OWASP für die Agentur empfiehlt Mindestberechtigungen, nachgelagerte Genehmigungen und menschliche Genehmigungen für Maßnahmen mit hoher Wirkung. Verwenden Sie die gleiche Trennung auf die Selbstmodifikation. Der Verbesserungsprozess erhält nur die Fähigkeit, um ein Kandidatenartefakt zu schreiben. Eine andere, kleinere Komponente besitzt die Bewertung und die Förderung. Eine nützliche Genehmigungsbescheinigung umfasst: Umfang des Empfangs auf die Kandidatenverarbeitung in einer echten Umsetzung. Verlängern Sie es. Akzeptieren Sie nicht der Agent kann sich selbst verbessern als ausführbare Genehmigung; es fehlt einer Oberfläche, Grenze und Zeitgrenze. Auf die Zustimmung zu warten, ist kein Scheitern. Wenn die Beweise überschreiten, aber die Veränderung der Oberfläche eine Person erfordert, muss AWAITING APPROVAL mit dem Kandidatenverdauung, gemessenen Delten, der angeforderten Oberfläche, dem Rücklaufziel und der vorgeschlagenen Kanariengröße zurückgegeben werden. Der Lauf ist gesund, wenn die Wartezeit ein Eigentümer und eine wiederauflösbare Entscheidung hat. Führen Sie die Tore in einer festen Reihenfolge durch Die Ordnung macht das Ergebnis erklärbar. Vor der Debatte über die Ergebnisse werden strukturelle Probleme abgelehnt: 1. IDentität: Die Verdauung ist gültig und der Elternteil des Kandidaten ist noch aktiv. 2. Schutzfläche: Der Bewerber kann keine Tests, keine Aufbewahrungsdaten, keine Autorität, keine Rücklaufgeschichte oder eine andere verbotene Oberfläche schreiben. 3. Paired Evidence: Elternteil und Kandidat verwendeten denselben verriegelten Beweissatz. 4. R Regressionsbudget: jede geschützte Metrik bleibt innerhalb ihrer eigenen Grenze. 5. Rollback: die benannte vorherige Version löst sich immer noch. 6. Materialgewinne: die Zielverbesserung räumt den vorgegebenen Boden frei. 7. AAutorität: die Quittung entspricht der Oberflächen und Kanariengrenze. Die ersten fünf Tore schützen Sicherheit und Überprüfbarkeit. Materialgewinn verhindert Schrottung: Eine Veränderung, die Lärm erzeugt, aber keine nützliche Verbesserung vorgenommen wird, sollte nicht nur dadurch gefördert werden, dass sie Sicherheitsprüfungen durchlaufen hat. Die Behörde entscheidet zwischen kanarischer und menschlicher Überprüfung. Das Begleitgerät implementiert diese Präzedenz ohne Modellaufruf. Führen Sie es aus dem Artikel Artefact Verzeichnis aus: Die acht Kandidaten teilen bewusst eine plausible Erfolgsgeschichte: Die meisten erhöhen die Zielscore. Ihre Entscheidungen unterscheiden sich: Bewerber Entscheidung Entscheidende Beweise Sicherer Schnellpatch CANARY READY Gepaarte Gewinne, keine geschützte Regression, begrenzte Autorität Wiederherstellungsänderung AWAITING APPROVAL Beweise gehen vorbei; Oberfläche erfordert eine Person Kleine Gedächtnisstunde HOLD NO MATERIAL GAIN Sicher, aber Zielgewinn ist nur 0.01 Staller Elternteil BLOCKED IDENTITY Kandidat wurde aus der falschen aktiven Basis generiert. Schriftsteller BLOCKED PROTECTED SURFACE Der Kandidat kann die Regel wechseln. Neue private Fälle BLOCKED EVIDENCE Der Bewerber hat das verschlossene Set nicht benutzt. Aggregate Gewinner BLOCKED REGRESSION Die Integrität der Werkzeugwirkung ist durch 0.03 gesunken Vermisste alte Version BLOCKED ROLLBACK Benannte Rollback Artefact ist nicht verfügbar Das nützliche Ergebnis ist nicht ein zusammengesetztes Sicherheitsscore. Es ist ein Zustand und eine Reparaturgrenze. Ein veralteter Elternteil braucht Regeneration. Eine geschützte Regression braucht eine Diagnose. Ein fehlendes Rückschlagziel benötigt die Wiederherstellung von Artefakten. Wenn man diese Scheitern durchschnittlich betrachtet, würde man das Eigentum verbergen. Kanarie, die Veränderung, nicht dein Selbstvertrauen. Wenn ein Kandidat die Offline Tore durchläuft, ist er für eine Kanarie berechtigt; es beweist nicht, dass die Produktion gesund ist. Begrenzen Sie Aufgaben, Zeit, Ausgaben, Werkzeuge und Nebenwirkungen. Halten Sie den Elternteil zur Verfügung. Die Kanarien Route funktioniert nur, deren Ergebnis unabhängig überprüft werden kann. Vergleichen Sie seine Live Receits mit einer gleichzeitigen oder kürzlich vorhandenen Basislinie, wenn die Arbeitsbelastung es zulässt. Definieren Sie die Rücklauf Trigger vor der Aktivierung: Verletzung der geschützten Metriken, unbekannte Ausgangsrate, Duplikateffekte, fehlende Genehmigungen, Ausgabenobergrenze oder Nachweis Frischeversagen. Rollback bedeutet die Wiederherstellung des exakten Muttermaterials und die Überprüfung, ob das beabsichtigte Aufgabenergebnis zurückkehrt. Ein Rollback Befehl, das abgeschlossen ist, ist Aktivität, nicht Wiederherstellung. Sie bewahren drei Aufzeichnungen nach dem Kanarien: die unveränderlichen Kandidaten und Elternverdauung; die Offline und Kanarische Beweise, einschließlich nicht verfügbaren Signale, gekoppelt; die Entscheidung über die Beförderung, die Aufrechterhaltung, die Genehmigung oder die Rückführung mit dem Erhalt der Befugnis. Wenn die Beweise verschwinden, geben Sie UNCERTAIN zurück und stoppen Sie die Beförderung. Verwandeln Sie keine fehlende Metrik in einen gesunden Wert. Wenn der gleiche Vorschlag wiederholt fehlschlägt, versucht die Grenze erneut und vermittelt sie an eine Person, anstatt die Verbesserungsschleife unbegrenzte Zeit und Token zu verbrauchen. Wissen Sie , was dieses Tor nicht beweisen kann . Die zur Verfügung gestellte Prüfung überprüft die manifeste Form, die Vorrangszahl, die gepaarte metrische Deltas, den Autoritätskapazität und die Rücklauflösung. Es beweist nicht, dass Ihre Halt out Produktion darstellt, dass eine menschliche Rubrik korrekt ist, oder dass ein seltener Fehler in 20 Kanarien Aufgaben erscheinen wird. Die Tests können veraltet werden. Bewertungsleute können die blinden Flecken des Modells teilen. Die externen Werkzeuge können sich nach dem Kandidatenpass ändern. Die praktische Standardlage ist daher eingeschränkt: die Kandidatengenerierung automatisch frei zu gestalten, die Risikobewertung sorgfältig zu automatisieren und die Aktivierung nur innerhalb eines ausdrücklichen Autoritätsbereichs zu automatisieren. Halten Sie beeinträchtige und irreversible Oberflächen vom Menschen zugelassen. Weiterbeobachtung nach der Beförderung, da ein selbstverbessernde Mittel nur dann gesund ist, wenn seine nützlichen Ergebnisse gesund bleibennicht, wenn seine Aktualisierungsleitung beschäftigt ist. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Seine Richtung besteht darin, eine gesundheitliche Schicht um die bestehenden Agentenlaufzeiten hinzuzufügen, mit Beweisen, Genehmigungsgrenzen und Ergebnisprüfung; Produktionsüberwachungsadapter und Wiederherstellungssysteme werden im Allgemeinen nicht versandt. Wenn diese Grenze übereinstimmt, wie Sie Agenten bedienen, können Sie Teil der privaten Vorschau.