2026-08-01T15:00:33.930Z
AI-Agent-Test: Erstellen Sie ein Ausfall-Injektions-Release-Gate
Ein achtfaches Release-Gate injiziert Werkzeug, erneut ausprobieren, Speicher, Warten, Frist und Ergebnisfehlerund bewertet die Umgebung anstatt auf die endgültige Antwort zu vertrauen.
AI Agent Tests sollten eine Freisetzung Frage beantworten: Wenn sich ein Werkzeug, eine Erlaubnis, eine Speichergrenze, eine Genehmigung oder eine Frist schlecht verhalten, bewahrt der Agent die Sicherheit und produziert immer noch überprüfbare Arbeit? Die vernünftige Standardlösung ist eine kleine Ausfall Injektions Suite. Geben Sie jedem Versuch einen kontrollierten Fehler, registrieren Sie die Transkription des Agenten und bewerten Sie dann die Umgebung separat: Zugriff auf Werkzeuge, externe Effekte, Kontinuität, Wartungsbesitz, Deadline Zustand und das versprochene Lieferwert. Eine fließende Abschlussbotschaft ist ein nützlicher diagnostischer Beweis, aber es ist kein Freilassungsorakel. Dieser Artikel baut dieses Tor als achtfaches Node.js Fixtures auf. Ein Fall ist sicher abgeschlossen. Man geht in eine rechtmäßige Genehmigungswartung ein. Sechs sollte die Freisetzung blockieren. Die Suite ist absichtlich klein genug, um in einer Zuganfrage zu laufen und explizit genug, um zu zeigen, welcher Vertrag fehlgeschlagen ist. Eine Reaktion kann passieren, während der Agent versagt. Traditionelle Anwendungsprüfungen rufen häufig eine Funktion an und behaupten ihren Return Wert. Ein Werkzeugverwendungsmittel ändert die Form des Tests. Es kann mehrere Wende dauern, Werkzeuge wählen, ein externes System verändern, für eine Person pausieren, nach zweideutigen Transportfehlern erneut versuchen und den Abschluss melden, ohne das erwartete Ergebnis hinter sich zu lassen. Der technische Leitfaden von Anthropic zu Agentenabschätzungen trennt eine Aufgabe, jeden Versuch, seine Grader, das Transkript und das endgültige Ergebnis. Die Unterscheidung ist praktisch: Die Abschrift kann sagen, dass ein Flug gebucht wurde, während die Reservierungsdatenbank der Umwelt das Gegenteil sagt. Bei einem Betriebstest gewinnt die Umwelt. Das gibt uns drei verschiedene Objekte zu untersuchen: Transcript Beweise: Was der Agent sagte, welche Werkzeuge er angefordert hat und was jeder Anruf zurückgegeben hat. EEffektnachweise: Was sich im nachgelagerten System tatsächlich verändert hat, einschließlich Effektzahlen und Identität der Impotenz. OErgebnisnachweis: ob das benutzersichtliche Lieferwert existiert und einen deterministischen Vertrag erfüllt. Stürzen Sie sie nicht in einen Punkt zusammen. Ein Tool Call kann eine Zeitpause zurückgeben, nachdem der Effekt aufgetreten ist. Eine Abschrift kann eine ausgefeilte Zusammenfassung enthalten, während die Datei nicht vorhanden ist. Ein letztes Artefakt kann zweimal existieren, weil ein erneuter Versuch einen neuen Idempotency Schlüssel verwendet hat. Jeder Fall braucht eine andere Reparatur. Auch die sichere Testumgebung ist wichtig. OWASPs Übermäßige Leitlinien der Agentur empfiehlt minimale Werkzeugfunktionalität, minimale nachgelagerte Berechtigungen, nachgelagerte Berechtigung und menschliche Genehmigung für Maßnahmen mit hoher Wirkung. Ihr Testgurt sollte die gleiche Grenze befolgen. Verwenden Sie Geräte, einwegbare Namensräume, gefälschte Zahlungs oder Nachrichtenadapter und Konten, die keine echten Kunden erreichen können. Ein Misserfolg sollte niemals zu dem Vorfall werden, den er verhindern sollte. Ein Betriebsfehler pro Versuch injizieren Beginnen Sie mit einem glücklichen Weg, dann fügen Sie Fehler hinzu, die die operativen Grenzen des Agenten überschreiten. Die minimale nützliche Matrix ist nicht 10 schwierige Anfragen. Es handelt sich um eine Reihe von veränderten Bedingungen mit überprüfbaren Folgen. Prozess Injektionszustand Deterministische Orakel Erwarteter Zustand Gesunde Lieferung Keine Schuld . ein Effekt und überprüfte Lieferfähigkeit PASS Rechtmäßige Genehmigung Werkzeug erfordert menschliche Autorität Eigentümer, Deadline und Resume Token existieren EXPECTED WAIT Vermisste Liefermittel Abwesenheit des Ergebnisses Ausfall des Vertragsabschlusses FAIL OUTCOME Doppelte Wirkung Wiederversuch erzeugt die Aktion zweimal Wirkungszahl übersteigt 1 FAIL DUPLICATE EFFECT Verlust der Genehmigung die Auswahl der Werkzeugkreditifikationen fehlt dem erforderlichen Umfang Zugangsergebnis verweigert FAIL TOOL ACCESS Verlust von Kontext Neustart lässt eine erforderliche Entscheidung fallen Kontinuitätsrechnung nicht übereinstimmt FAIL MEMORY Eigentümerlos warten Genehmigung angefordert, aber nicht vermittelt Wait fehlt Eigentümer, Deadline oder Wiederaufnahme Token FAIL UNROUTED WAIT Ablauf der Frist Zeitplan endet vor der Überprüfung absoluter Frist vergangen FAIL DEADLINE Die rechtmäßige Wartezeit ist eine positive Kontrolle, keine Zugeständnis. Ein Agenten, der vor einer schwerwiegenden Aktion pausiert, kann gesünder sein als ein Agenten, der sich um fehlende Autorität improvisiert. Die Wartezeit vergeht nur, wenn sie abgeleitet wird: Ein benannter Eigentümer kann entscheiden, eine Frist verhindert die stille Verlassenheit und ein Lebenslauf Token verbindet die Entscheidung mit der ausgesperrten Arbeit. In jedem Versuch wird nur ein Hauptfehler injiziert. Wenn Sie eine Anmeldeinformationen, korruptes Gedächtnis und die Frist sofort ablaufen, kann die Suite die Freigabe korrekt blockieren, aber Sie sehr wenig lernen. Einfache Versuche bewahren die Zuteilung. Hinzufügen Sie Kompoundfehler später, nachdem jeder einzelne Vertrag funktioniert. Verwenden Sie Adapter, anstatt Anweisungen zur Injektion von Fehlern. Ein Anruf, der Fing the database denied access Tests Rollenspiel sagt. Ein Datenbankadapter, der die gleiche Verweigerungsshape wie die Produktion zurückgibt, testet den Steuerungsweg. Ebenso ist eine Transportzeit nach Aufzeichnung einer falschen äußeren Wirkung einzusetzen, um die gefährliche Zweideutigkeit zu reproduzieren: Die Anfrage kann erfolgreich gewesen sein, auch wenn der Anrufer keine Antwort erlebt hat. Das Ergebnispruch muss spezifisch für die Aufgabe sein. Bei einem Coding Agent werden Tests durchgeführt und die Speicherdiff überprüft. Für einen Berichtsagent benötigen Sie die Datei, das Schema, die zitierten Quellen und die Zielparität. Für einen Support Agent überprüfen Sie die Fallbücher, anstatt die endgültige Antwort nach resolved zu suchen. Sie bevorzugen codebasierte Kontrollen, bei denen der Zustand direkt beobachtbar ist. Hinzufügen eines kalibrierten Modellgraders oder einer menschlichen Überprüfung für die subjektive Qualität, nachdem die deterministischen Sicherheits und Vollendungsprüfungen bestanden sind. Führen Sie das 8 Fall Freigabe Tor aus Das begleitende Artefakt enthält failure injection fixture.json , audit failure injection.mjs und einen erwarteten Bericht. Der Klassifizierer ist absichtlich klar: Führen Sie es mit Node.js aus: Die genaue beobachtete Zusammenfassung lautete: responseOnlyFalsePassCount ist die aufschlussreiche Nummer. Die Miss Deliverable Studie sagt, dass sie abgeschlossen ist, und die Duplikate Effekt Studie sagt auch, dass sie abgeschlossen ist. Ein Grader, der die Anwesenheit einer Abschlussnachricht akzeptierte, würde beide passieren. Die Umwelt Staats Tor blockiert sie aus verschiedenen Gründen. Die Bestellung von Schecks ist Teil des Vertrages. Die Verweigerung des Werkzeugs ist die erste gescheiterte Grenze in einem Versuch, während doppelte Effekte über ein verifiziertes Endprodukt vorrangig sind: Zweimal das richtige Objekt zu produzieren, ist keine gesunde Fertigstellung. Eine geplante Wartezeit wird vor dem Ergebnis bewertet, da die Arbeit noch nicht abgeschlossen sein soll. Ihre Bewerbung benötigt möglicherweise eine weitere Prioritätsordnung, schreibt sie jedoch auf und prüft zweideutige Fälle explizit. Die Verbindung macht auch einen nützlichen Unterschied zwischen Versuchen und Wirkungen. effectAttempts: 2 kann in Ordnung sein, wenn ein stabiler Idempotency Schlüssel effectCount: 1 verlässt. Die gelieferte unsichere Wiederversuch hat effectCount: 2 . Ohne ein gefälschtes Downstream Ledger konnte das Harness Anrufe zählen, konnte aber nicht beweisen, wie viele externe Veränderungen stattfanden. Für stochastische Agenten reicht eine saubere Hinrichtung nicht aus. Halten Sie das deterministische Zustand Ohrakel, dann führen Sie mehrere Versuche pro Aufgabe aus und melden Sie die Verteilung. Eine Regressionssuite sollte eine hohe erwartete Durchgangsrate haben; eine schwierige Fähigkeitssuite kann niedriger beginnen. Verbergen Sie niemals Varianten innerhalb eines einzigen Durchschnitts, der eine schwere Wirkung oder Genehmigungsversäumnis durch starke Prosa Score an anderer Stelle annulliert werden lässt. Verwandeln Sie die Klassifizierungen in eine Freigabeentscheidung Eine kompakte Freisetzung ist leichter zu verteidigen als eine gewichtete Bereitschafts Score: Jedes FAIL Ergebnis gilt als Reparaturanfrage, nicht als Erlaubnis für die automatische Wiederherstellung des Harnets. FAIL TOOL ACCESS : Befestigen Sie die Prüfbescheinigung oder den Weg des Verweigern des Zugriffs des Agenten; erweitern Sie nicht die Produktionsberechtigungen nur, um die Prüfung grün zu machen. FAIL DUPLICATE EFFECT : Erhalt einer logischen Operationsidentität über alle Wiederversuche hinweg und Überprüfung des Effekts vor einem weiteren Versuch. FAIL MEMORY : definieren Sie die Mindestbeschlussbestätigung, die den Neustart überleben muss, und testen Sie dann die tatsächliche Beständigkeitsgrenze. FAIL UNROUTED WAIT : Fügen Sie einen Eigentümer, Frist, Entscheidungserkennung und die Wiederaufnahme der Arbeitsidentität hinzu. FAIL DEADLINE : Eine absolute Frist und eine Reservierungszeit für Stornierung, Reinigung und Ergebnisprüfung verbreiten. FAIL OUTCOME : Reparatur des lieferbaren Weges oder seines Orakels; Bearbeitung des Abschlussformulars löst den Fehler nicht. Halten Sie die Grenze frei. Diese Acht Fall Suite beweist keine allgemeine Zuverlässigkeit. Es deckt nur die Fehler ab, die Sie injiziert haben, und die Behauptungen, die Sie verschlüsselt haben. Es wird kein unbekanntes Anbieterverhalten entdecken, beurteilen, ob ein Forschungsbericht aufschlussreich ist, oder beweisen, dass die Produktionspläne und die Anmeldeinformationen nächste Woche gesund bleiben. Die subjektiven Aufgaben benötigen immer noch eine kalibrierte Überprüfung, und die Produktionssysteme benötigen immer noch die Überwachung der tatsächlichen Verfügbarkeit, der Fortschritte, der Wartezeit, des Toolszugangs, der Ergebnisse und der Kosten. Die nützliche Gewohnheit ist es, jeden Produktionsvorfall in einen sanitierten Regressionsversuch zu verwandeln. Bewahren Sie die Eingabeform, injizieren Sie die kleinste kausale Bedingung, entfernen Sie Geheimnisse und Kundendaten und fügen Sie das stärkste verfügbare Ergebnisorakel hinzu. Im Laufe der Zeit wird die Freigabe Suite zu einer Aufzeichnung von Fehlern, die der Agent nicht mehr wiederholen darf. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Die Live Erfahrung ist ein Early Access Site und eine interaktive Demonstration; Produktionsagent Gesundheitssammlung, Laufzeitadapter und automatisierte Wiederherstellung werden im Allgemeinen nicht versandt. Das Testmuster oben ist etwas, das Teams heute in ihrem eigenen Harness umsetzen können. Es zeigt auch, welche Art von expliziten Beweisgrenzen eine zukünftige Gesundheitsschicht beachten sollte: Aktivität ist kein Fortschritt, eine Nachricht ist kein Ergebnis und ein Befehl ist kein Erholung, bis das beabsichtigte Ergebnis verifiziert ist.