2026-08-01T14:17:41.135Z
AI Agent Guardrails: Bauen Sie ein Aktionsport mit vier Kontrollen
Separate Richtlinien, genaue Genehmigungen, Ausführungsgrenzen und Effektüberprüfung, bevor Sie einem Agent-Tool-Anruf vertrauen.
AI Agent Guarderrails dürfen nicht mit einem Anruf, einem Klassifizier oder einem Genehmigungsknopf versehen werden. Für einen Agenten, der den externen Zustand ändern kann, ist das praktische Standard ein 4 steuerliches Aktionsgate: entscheiden Sie, ob die Aktion erlaubt ist, beweisen Sie, dass der Anrufer die Autorität für diese genaue Aktion hat, binden Sie den Versuch, dann überprüfen Sie die externe Wirkung. Jede Kontrolle beantwortet eine andere Frage. Wenn sie in einer einzigen safe: true Flagge kombiniert werden, wird verborgen, ob ein Agent blockiert ist, auf eine Person wartet, aus dem Budget ausgeht oder einfach nur nach einem Tool Aufruf Beweise fehlen. Halten Sie diese Zustände getrennt und das System kann schließen, ohne jede Pause als Vorfall zu behandeln. Die Politik an die Grenze des Handelns stellen Beginnen Sie damit, zu verkleinern, was der Agent von einem Werkzeug verlangen kann. Ein politisches Tor sollte strukturierte Handlungsdaten erhalten, nicht nur Prosa: Das politische Ergebnis sollte ein allow , deny oder unknown sein. Unknown ist wichtig. Eine fehlende Klassifizierung ist keine Erlaubnis, und die Zwingung von Zweideutigkeiten in allow oder deny macht das Modell im Namen des Betreibers zu einer Erfindungssicherheit. Dieses Tor muss auch überprüfen, ob das Werkzeug in die Fähigkeitsgruppe des Agenten gehört. Die OWASP Richtlinie über übermäßige Agentur identifiziert übermäßige Funktionalität, Berechtigungen und Autonomie als separate Ursachen. Seine Minderungen sind entsprechend konkret: nur notwendige Erweiterungen aufzeigen, schmalen Funktionen gegenüber offenen Befehlen bevorzugen, Mindestberechtigungen nachgelagert gewähren und die Berechtigung im nachgelagerten System durchsetzen. Diese letzte Grenze zählt. Eine Anweisung wie never delete production data ist ein nützlicher Kontext, ist aber keine Genehmigungssteuerung. Ein Löschendpunkt sollte eine nicht autorisierte Identität ablehnen, auch wenn ein Agenten einen überzeugenden Grund hervorbringt. Ebenso sollte ein nur leser Arbeitsfluss keinen Kunden erhalten, dessen Anmeldeinformationen erfassen kann. Modellschutzränge haben immer noch einen Job, aber wissen Sie, wann. Die OpenAI Agents SDK Dokumentation unterscheidet die Ein und Ausgangsschutzschrauben von Funktions Tool Schutzschrauben. Es wird auch darauf hingewiesen, dass eine parallele Eingabe Schutzraille beendet werden kann, nachdem der Agent bereits Token oder ausgeführte Werkzeuge verbraucht hat. Für eine Nebenwirkungsgrenze, verwenden Sie einen Block Check unmittelbar vor der Ausführung, unterstützt durch echte nachgelagerte Genehmigung. Der angemessene Standard ist: Verweigerung von Werkzeugen außerhalb einer Genehmigungsliste pro Agenten; Berechnen Sie die erforderlichen Bereiche aus der strukturierten Maßnahme; diese Bereiche außerhalb des Modells durchsetzen; unknown zurückgeben, wenn die Politikinputs unvollständig sind; die Politikversion und die Aktionsversion mit der Entscheidung aufzuzeichnen. Inhaltsfilter ersetzen dieses Tor nicht. AWS Connect AI Guarderrail Dokumentation deckt verweigerte Themen, Inhaltsfilter, Erdungskontrollen, Wortfilter und sensible Informationskontrollen ab und dokumentiert gleichzeitig Konfigurationsgrenzen und Latenz Kompromissen. Das sind nützliche Garantien für Eingangs und Ausgangssysteme. Sie beweisen nicht, dass eine Freisetzung, Zahlung, Nachricht oder Datei Mutation autorisiert ist. Bind die Zustimmung an eine Handlung, nicht an ein Gespräch. Genehmigter ist zu vage, um ihn auszuführen. Eine sichere Genehmigung ist ein kurzlebiger Autoritäts Abschluss, der an die genaue Handlung der überprüften Person gebunden ist. Mindestens beharren: Erneuern Sie die Aktionsvergiftung unmittelbar vor der Ausführung. Wenn sich die Ressource, die Argumente, die Akteure, das Werkzeug, die Auswirkungen oder das Ablaufzeitraum unterscheiden, entspricht die Genehmigung nicht. Fragen Sie noch einmal, anstatt eine alte Entscheidung über eine neue Arbeit zu erstrecken. Dies verhindert eine ruhige, aber ernsthafte Klasse von Misserfolgen. Eine Person kann einen Release Kandidaten für ein Repository genehmigen, dann ändert sich der Kontext des Agenten, ein erneuter Versuch rekonstruiert verschiedene Argumente oder ein anderer Lauf wieder verwendet den gleichen Konversationszustand. Ein frei schwimmendes Boolean überlebt alle drei Fehler. Eine aktionsgebundene Quittung tut es nicht. Die Genehmigung benötigt auch einen Eigentümer und einen wiederverwertbaren Status. awaiting approval ist nicht stuck : Es hat eine benannte Entscheidung, eine Route zur richtigen Person und ein Ablauf. Nach einer Entscheidung, wiederholen Sie aus der gefrorenen Aktionsumschuld, anstatt die Planung wieder auszuführen und zu hoffen, dass das Modell die gleiche Operation vorschlägt. Nicht jede Aktion braucht einen Menschen. Verwenden Sie die Wirkung, um zu entscheiden: nur zu lesen, umkehrbare Maßnahmen mit geringer Reichweite können im Rahmen einer ständigen Politik durchgeführt werden; Änderungen mit begrenztem, gut getesteten Rückgang können ausdrückliche Grenzwerte und Prüfung verwenden; öffentliche, finanzielle, zerstörerische, Privilegienveränderende oder sonstige Maßnahmen mit hohem Einfluss erfordern eine genaue Genehmigung; Zweideutigkeit über die Schlagwege zu einer Person. Die menschliche Überprüfung ist daher eine Kontrolle innerhalb des Stapels, nicht der Stapel selbst. Begrenzte Vollstreckung auch nach Genehmigung Eine zulässige und genehmigte Aktion kann immer noch schlechte Ergebnisse erzielen. Der Vollstrecker benötigt harte Grenzen, die der Agent nicht schweigend neu verhandeln kann: eine absolute Frist, die vor jedem Versuch überprüft wird; eine maximale Anzahl von Versuchen; ein Schlüssel zur Abwehr von Nebenwirkungen; eine Höchstgrenze für Ressourcen und Auswirkungen; eine Stornierungsroute; Eine Regel für das, was passiert, wenn das Ergebnis zweideutig ist. Die Betriebsidentität muss über alle erneuten Versuche hinweg stabil bleiben. Wird eine Transportzeitverzögerung nach einer Änderung des Bestimmungsortes erfolgt, kann die Ausstellung einer neuen Betriebsidentität die Wirkung doppelt ersetzen. Wenn die Bestimmungsstelle die Idempotency unterstützt, wird der gleiche Schlüssel wiederverwendet. Wenn es eine autoritäre Suche bietet, versöhnen Sie sich, bevor Sie es erneut versuchen. Wenn keine davon existiert, hören Sie mit unverified auf, anstatt zu raten, dass ein weiterer Versuch sicher ist. Halten Sie den Exekuteur mechanisch. Ein Modell kann einen erneuten Versuch empfehlen, aber der Code sollte entscheiden, ob attempt < maxAttempts , die Frist frisch ist, die Ressource immer noch übereinstimmt und die Aktion einen verwendbaren Idempotency Schlüssel hat. Dies ist einer der seltenen Orte, wo langweilige Konditionen genau das richtige Design sind. Die Grenzen dienen nicht nur der Schadensbekämpfung. Sie bewahren die Diagnose. Ohne sie kann ein wiederholter Anruf wie eine Persistenz aussehen, eine abgelaufene Operation wie ein langsamer Fortschritt und ein doppelter Effekt wie eine Erholung. Mit ausdrücklichen Grenzen kann der Betreiber die Arbeits , Warte , Blockierungs und Unsicherheitszustände unterscheiden. Überprüfen Sie die Wirkung unabhängig Eine Antwort auf das Werkzeug beweist, was das Werkzeug gemeldet hat, nicht unbedingt, was der Benutzer benötigt. Das letzte Tor vergleicht eine beobachtbare Nachbedingung mit dem versprochenen Ergebnis. Es ist vorzugsweise deterministischer Beweis: das erstellte Objekt mit stabiler ID zu holen; die Zielseite oder die Veröffentlichungsbüro lesen; Überprüfen Sie, ob die erwartete Datei existiert und ihre Hash Matches; die entsprechenden Prüfungen durchführen; bestätigen, dass eine Nachricht im beabsichtigten Bestimmungsort angezeigt wird; Vergleichen Sie die Vor und Nachwerte der exakten Ressource. Verwenden Sie nicht das gleiche schwache Signal zweimal. Wenn der Schreibendpunkt { "ok": true } zurückgibt, ist das Kopieren dieses Feldes in einen Abschlussregister keine unabhängige Überprüfung. Lesen Sie von der zugelassenen Bestimmung oder überprüfen Sie die versprochenen Lieferungen. Einige Ergebnisse können nicht sofort überprüft werden. Eine Benachrichtigung kann angenommen werden, aber nicht geliefert werden, einem externen Anbieter kann eine Lese API fehlen oder ein Beobachtungskanal kann veraltet sein. Stellen Sie als unverified vor, die fehlenden Beweise und die nächste sichere Überprüfung einzubeziehen und den Erfolg zu vermeiden. Hier treffen sich Sicherheit und Gesundheit. Politik und Genehmigung verhindern verbotene Handlungen; Effektprüfung verhindert falsche Vollendung. Ein Agent kann jede Zugangsregel befolgen und trotzdem seine Aufgabe versagen. Im Gegenteil, ein erfolgreiches Ergebnis entschuldigt keinen unbefugten Weg. Wiederholen Sie neun Fälle, bevor Sie dem Entwurf vertrauen. Das begleitende Artefakt verwandelt die vier Steuerungen in einen kleinen ausführbaren Test. guardrail cases.json enthält neun vorgeschlagene Maßnahmen. evaluate agent guardrails.mjs hat eine feste Vorrangsregelung: 1. die Politik; 2. Bereiche und Genehmigungsbehörde; 3. Ausführungsgrenzen; 4. Wirkungsbeweise. Führen Sie es mit: Die reproduzierte Zusammenfassung ist: Die interessanten Fälle sind nicht der klare Pass oder die offensichtliche Ablehnung. Eine Genehmigung ist abgelaufen. Ein weiterer wurde für einen anderen Handlungsfingerprint ausgestellt. Ein Schreiben erschöpfte sein erneutes Budget. Ein Befehl lief ohne beobachtbare Wirkung. Eine Politik kann die Aktion überhaupt nicht klassifizieren. Diese Fälle zeigen, warum die staatliche Präferenz explizit sein muss. Überprüfen Sie zuerst die Effektnachweise und eine nicht autorisierte Handlung kann als unüberprüft bezeichnet werden. Überprüfen Sie die Genehmigung vor der Politik und Sie können eine Person bitten, ein Werkzeug zu autorisieren, das nie verfügbar sein sollte. Unbekannter Zusammenbruch in Ablehnung und der Betreiber verliert ein reparierbares Datenqualitätssignal; Zusammenbruch in erlauben und das System erfindet Autorität. Passen Sie das Gerät an Ihre eigenen Werkzeuge an. Hinzufügen von Fälle für Ressourcenersatz, Umfangverlust, Wiederverwendungsgenehmigungsunfälle, veraltete Richtlinienversionen, Ablaufzeit, teilweise Effekte, Rücklauffehler und einen Überprüfungskanal, der nicht mit der Antwort des Tools übereinstimmt. Das Tor ist nur dann bereit, wenn diese Fehler den Zustand und die nächste Aktion hervorrufen, die Sie beabsichtigt haben. Halten Sie die Grenze ehrlich AI Agenten Guarderrails funktionieren, wenn jede Kontrolle das Veto der Aktion aus eigenen Gründen und die Beweise für diese Entscheidung aufdecken kann. Die Kompaktsregel ist: Die Politik entscheidet, ob die Aktion zu Hause ist. Die Autorität verbindet, wer genau was tun kann. Die Grenzen beschränken den Versuch. Die Überprüfung beweist die Wirkung. Dies kostet mehr als das Hinzufügen eines Klassifikators. Genaue Genehmigungen erhöhen die Wartezeit. Lesen nach Schreiben Checks fügen Anrufe hinzu. Schmale Werkzeuge erfordern Ingenieurwesen. Unbekannte Staaten benötigen die Handhabung des Betreibers. Der Handel lohnt sich bei Nebenwirkungen, denn Zweideutigkeit bleibt sichtbar, anstatt zu schweigender Autorität oder falschem Erfolg zu werden. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Es ist als Gesundheitsschicht um bestehende Agentenaufstellungszeiten gedacht, aber die Sammlung und Wiederherstellung von Produktionsagentenaufnahmen und hilfe werden nicht im aktuellen Website Repository versandt. Der Kontrollstack hier ist ein Implementierungsmuster, das Sie jetzt testen können, nicht eine Behauptung, dass Sidewisp es derzeit durchsetzt. Wenn Sie Sidewisp für zukünftige Arbeitsflüsse im Bereich Agenten Gesundheit bewerten, schließen Sie sich der privaten Vorschau an. In der Zwischenzeit sollten Sie die Handlungshülle und ihre Beweise in Ihrer eigenen Laufzeit aufbewahren: Die sicherste Schutzziegel ist die, die immer noch hält, wenn das Modell zuversichtlich falsch ist.