2026-08-01T15:00:27.124Z

AI Testrahmen für Agenten: Wählen Sie nach Beweisen, nicht nach Merkmalen

Ein laufbarer Vier-Tore-Selektor vergleicht Wiedergabe, Werkzeug-Effekt, Speicher und Ergebnis-Beweisedann stellt die Adapter jeder Empfehlung noch benötigt aus.

Ein AI Testrahmen sollte nach den Beweisen, die er reproduzieren und überprüfen kann, und nicht nach der Anzahl der Kennzahlen in seinem Katalog ausgewählt werden. Für einen staatlichen, Werkzeugverwendenden Agent ist der vernünftige erste Prototyp Inspekte AI, wenn Einwegumgebungen, Externe Agent Exekution und Code Scorers zentral sind. LangWatch Scenario ist der besser geformte Prototyp, wenn simulierte Benutzer und mehrfach gedankliches Verhalten dominieren. MLflow passt zu Teams, deren Evaluierungsdaten und Experimentgeschichte bereits die Organisationsschicht sind; DeepEval passt zu einem pytest zentrierten Regressionsworkflow. Das ist eine Prototypenordnung, nicht ein universelles Leaderboard. Keines dieser Frameworks weiß, ob eure Rechnung einmal erstellt wurde, eure Speicher einen Neustart überlebt hat oder eure versprochenen Lieferwert gültig ist. Das sind Anwendungsorakel. Ein Auswahlverfahren ist nur ehrlich, wenn es die restlichen Arbeiten vor der Adoption benennt. Beginnen wir mit den Beweisen, die der Rahmen hinterlassen muss. Agent Tests sind keine vergrößerten Prompttests. Ein Agent ändert den Zustand über mehrere Wende, überschreitet die Zulassungsgrenzen, ruft Werkzeuge an, wartet, versucht erneut und kann mit einem externen Artefakt beenden. Eine fließende endgültige Antwort ist eine Beobachtung unter mehreren. Antropics Handbuch zur Agentenabschätzung trennt die Aufgabe, die Tests, die Transkription, das Ergebnis, die Bewertung und die Grader. Es unterscheidet auch Code basierte, Modell basierte und menschliche Einstufung. Diese Zerlegung gibt uns eine nützliche Auswahlfrage: Woher wird jede entscheidende Tatsache stammen? Verwenden Sie vier Tore: Tor Nachweis erforderlich Häufige falsche Substitute Wiederholung Das gleiche Gerät kann relevante Eingaben, Werkzeugzustand, Berechtigungen und Startdaten wiederherstellen Wiederversenden der gleichen Anforderung Werkzeugwirkung Die Bestimmung beweist, dass die beabsichtigte Wirkung mit der richtigen Identität und Anzahl stattfand. Eine Spur sagt, dass das Werkzeug genannt wurde. Speicherkontinuität Die erforderlichen Entscheidungen überstehen die Grenze, vor der man sich wirklich fürchtet: Neustart, Kompaktion oder Übergabe Das Gespräch hat mehrere Wende. Prüfung der Ergebnisse Eine deterministische Prüfung beweist, dass das versprochene Artefakt oder der Staat existiert und gültig ist. Der Agent sagt , es ist vorbei . Ein Rahmen kann die Haken für alle vier aufdecken, ohne Ihre vier Beweise zu implementieren. Das ist akzeptabel. Das schlechte Ergebnis ist, eine benutzerdefinierte Datenbank Abfrage, ein Neustart Fixter oder einen Artefakt Validator unter dem vagen Etikett Integration zu verstecken. Die Unterscheidung zählt am wichtigsten an zwei Grenzen. Ein Tool Call kann ablaufen, nachdem das Ziel seine Änderung begangen hat, so dass Transporterfolg und Effekterfolg unterschiedlich sein können. Ein Mehrfachversuch kann den Zustand in einem Prozess bewahren, während der eingesetzte Agent nach einem Neustart die gleiche Entscheidung verliert. Wenn ein Rahmenvergleich eines der beiden Paare zusammenbricht, ist seine Punktzahl für die Zuverlässigkeit des Agenten nicht nützlich. Vier aktuelle Rahmenwerke, die durch die Tore gelesen werden. Ich habe am 27. Juli 2026 die aktuelle offizielle Dokumentation überprüft und nur dokumentierte Oberflächen aufgezeichnet. Ein Niveau von Custom unten ist keine Kritik; es bedeutet, dass der Rahmen einen Ausdehnungspunkt bietet, während die Anwendung die Wahrheit liefern muss. Iinspect AI dokumentiert komponierte Datensätze, Agenten, Werkzeuge und Scorer, Ausführung durch externe Agenten, Evaluationsprotokolle und mehrere Sandbox Backends. Sein offizieller Überblick verwendet sogar einen Agenten, der durch Werkzeuge in einer Docker Sandbox wirkt. Das macht es zu einer starken Ausgangsoberfläche für ausführbare, statistische Aufgaben. Ein benutzerdefinierter Scorer kann die resultierende Umgebung überprüfen. Es braucht immer noch einen Anschluss zum realen Ziel und ein bewusst konstruiertes Wiederstart Speicher Oracle. LangWatch Scenario beginnt mit einer Mehr Turn Simulation und nicht mit einer statischen Eingabe Ausgabe Zeile. Die Agent Simulationsdokumentation zeigt Zwischen Tool Call Erwartungen, benutzerdefinierte Behauptungen wie ein erstelltes Ticket, Fehler Recovery Tests und die Reproduktion von Problemen in der Produktion. Diese Form ist attraktiv für Unterstützung, Stimme und andere interaktive Agenten. Der dokumentierte Gesprächssatz ist kein Beweis dafür, dass eine Entscheidung den Tod des Prozesses überlebt hat, und eine Ticket Behauptung ist immer noch Bewerbungscode. MLflow organisiert die Bewertung rund um Datensätze, Vorhersagefunktionen, Scorer, Laufresultate, menschliches Feedback und Überwachung. Die Überblick über die aktuelle GenAI Evaluierung macht die benutzerdefinierte Punktzahlung zu einem erstklassigen Teil eines Bewertungslaufs. Dies ist nützlich, wenn das Team bereits Datensätze und Experimente als Quelle der Wahrheit behandelt. Die Auswahlkosten sind die Zustandgehalt um die Vorhersagefunktion: Wiederherstellung einer Werkzeugwelt, Zwangswiederstart und Aussöhnung externer Effekte. DeepEval bietet lokale Testläufe, Ein und Mehr Turn Fälle, Schwellenwerte, Verfolgung und Regressionsvergleich in einem pytest förmigen Workflow. Sein Schnellstart ist eine einfache Anlaufstelle für Teams, die neben Anwendungsprüfungen Auswertungen wollen. Der Quickstart stützt sich auf modelbasierte Metriken, daher sollte ein Betriebsergebnis für die Anpassung deterministische Effekt und Ergebnisprüfungen hinzufügen, anstatt davon auszugehen, dass ein Richter Score den Bestimmungszustand beweist. Rahmenbedingungen Dokumenterter Schwerpunkt Erst prototypieren, wenn Ausdrückliche Adapter zur Prüfung Inspektion von AI Ausführbare Agentenaufgaben, Werkzeuge, Sandboxen, Teller Der Agent ändert die Dateien oder einen anderen überprüfbaren Zustand Echtes Ziel Effekt; Neustart Speicher LangWatch Szenario Simulationen mit mehreren Drehungen und Schrittenbehauptungen Benutzerverhalten und Wiederherstellungswege führen zu Fehlern Echtes Ziel Effekt; Neustart Speicher MLflow Datensätze, Scorer, Laufgeschichte, Feedback Die Bewertung des Lebenszyklus und der Abstammung leben bereits in MLflow Zustandsgestellte Einrichtung; Wirkung; Wiederanlauf Speicher Diep Eval Metrische Regression und Verfolgung im Pytest Stil Das Team braucht einen leichten Einstiegspunkt. Zustandsgestellte Anlage; Effekt; Wiederanlauf Speicher; deterministisches Ergebnis Diese Tabelle ist absichtlich enger als ein Produktvergleich. Es sagt nichts über Hosted Preise, Support, Wartungsresponsfähigkeit oder jede Integration. Es beantwortet eine Frage: Welche dokumentierte Exekutionsoberfläche ist dem Beweis am nächsten, der für diesen Agenten benötigt wird? Führen Sie den Auswählger aus, dann misstrauen Sie die Punktzahl. Das begleitende framework evidence.json erfasst vier Beweiswerte für jeden Bewerber. 0 bedeutet, dass keine vorhandenen Beweise der primären Quellen vorhanden sind, 1 bedeutet, dass ein ausdrücklicher benutzerdefinierter Adapter oder Scorer erforderlich ist und 2 bedeutet, dass die Dokumentation einen erstklassigen Workflow darstellt. Das Status Tool Szenario weist auf 2 Wiedergabe, Werkzeug Effekte auf 4 , Speicherkontinuität auf 4 und überprüfte Ergebnisse auf 5 . Führen Sie das Artefakt aus: Der entscheidende Teil der Produktion ist: Inspect und LangWatch Scenario erhalten beide einen gewichteten Beweiswert von 22 . Inspect gewinnt nur, weil die angegebene Arbeitsbelastung stateful tool ist, was einen 3 Punkte Fit Bonus hinzufügt. Verändern Sie die Arbeitsbelastung auf mehrfach drehende Simulation und die Reihenfolge sollte sich ändern. Ändern Sie die Gewichte und das Ergebnis kann sich ändern. Diese Empfindlichkeit ist ein Merkmal: Sie macht die Annahmen des Teams überprüfbar. Die Punktzahl darf keine Lücken löschen. Ein Ergebnis, das behauptet, dass die Adapterarbeit hier null wäre, wäre weniger glaubwürdig, nicht mehr. Die Matrix kann das Schema der Bestimmung, die Identitätsregel für einen Effekt, die Entscheidungen, die das Gedächtnis behalten muss, oder die Gültigkeitsregel für das zu lieferende nicht kennen. Das Artefakt hat auch eine schwierige Begrenzung: Es handelt sich um eine datierte Dokumentationsprüfung. Es installiert nicht alle vier Rahmenbedingungen oder misst die Integrationszeit nicht. Verwenden Sie es, um die Reihenfolge der Experimente zu wählen, dann lassen Sie zwei unangenehme Fälle entscheiden. Der Nachweis der Eignung wird auf zwei verschiedene Arten versagt. Der erste Fall testet einen zweideutigen Werkzeugeffekt. Bereiten Sie eine Bestimmungsanordnung ein, bei der das Werkzeug ein Objekt verbindet und der Transport dann eine Zeitpause zurückgibt. Das Harness kann nur passieren, wenn es: 1. eine stabile Betriebsidentität über die Grenze des erneuten Versuchs zu erhalten; 2. die Bestimmungsort zu überprüfen, anstatt sich auf das Ergebnis des Anrufs zu verlassen; 3. den Staat als verpflichtet zu klassifizieren, nicht blind wieder zu versuchen; 4. Zeigen Sie die Beweise in einem Laufregister, den ein Entwickler debuggen kann. Bei den zweiten Fallversuchen wird die Kontinuität neu gestartet. Lassen Sie den Agenten einen begrenzten Plan auswählen, nur den zulässigen Entscheidungszustand bestehen, den Prozess beenden und mit einem neuen Prozess fortsetzen. Das Harness kann nur passieren, wenn es: 1. Nachweisen, dass der Neustart stattgefunden hat; 2. Wiederherstellen des gleichen Geräts ohne Leckage des versteckten Antwortzustands; 3. Überprüfen, ob die erforderliche Entscheidung überlebt ist; 4. Veraltetes, fehlende oder widersprüchliches Gedächtnis erkennen; 5. das endgültige Artefakt unabhängig überprüfen. Eine rechtmäßige Wartezeit als Kontrollzeit, wenn der Agent die Genehmigung anfordert. Ein Prüfband, das jede Pause als Ausfall markiert, wird das Produkt unter Druck setzen, um sichere Autoritätsgrenzen zu entfernen. Die Beweise sollten zwischen Arbeit, Warten, Stehen und Vollenden unterscheiden und nicht ununterbrochenen Aktivitäten belohnen. Zeitkasten der Prototypen. Ein kleines Team sollte eine allgemeine Adapter Schicht nicht bauen, bevor es diese beiden Fehler wiedergegeben hat. Geben Sie jedem Kandidaten das gleiche Instrument, das gleiche Ergebnis Oracle und das gleiche Debug Budget. Es wird vorgezogen, dass der Rahmen, der die Beweiskette am kürzesten und am besten überprüfbar macht, auch wenn ein anderer Kandidat mehr aggregierte Metriken erstellt. Das Ergebnis ist nicht Framework X ist am besten. Es ist Framework X erreicht unsere beiden Hard Provies mit diesen benannten Adaptern, und Framework Y nicht innerhalb des gleichen Budgets. Diese Aussage kann eine Code Review überleben. Testbeweise sind nicht lebende Agentengesundheit Die Bewertung vor der Veröffentlichung beantwortet, ob ein Build bekannte Aufgaben und kontrollierte Fehler bewältigen kann. Live Health fragt, ob ein bestimmter eingesetzter Agent jetzt erreichbar ist, nützliche Fortschritte macht, den erforderlichen Kontext behält, seine Werkzeuge erreicht, das erwartete Ergebnis erzielt und innerhalb von vernünftigen Zeit und Kostengrenzen bleibt. Eine Beurteilung zu bestehen, beweist nicht, dass ein Terminplaner gestern abgeschossen wurde, eine Auskunftserklärung heute gültig ist oder ein Lieferwert sein tatsächliches Ziel erreicht hat. Sidewisp ist die gesundheitliche Schicht rund um die bestehenden Laufzeiten: Unterscheidung zwischen der Arbeit und der Wartezeit oder der Verspannung, Nachweis und Frische und Überprüfung der Ergebnisse, bevor ein Problem gelöst wird. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Die öffentliche Erfahrung ist eine Website für den frühen Zugriff und eine interaktive Demonstration; Produktionsagent Gesundheitssammlung, Laufzeitadapter und automatisierte Wiederherstellung werden im Allgemeinen nicht versandt. Also halten Sie die Grenze explizit. Verwenden Sie den gewählten Prüfrahmen, um kontrollierte Regressionen vor der Veröffentlichung sichtbar zu machen. Verwenden Sie spezifische Beweise für die Laufzeit und unabhängige Ergebnisprüfungen, um nach der Freisetzung die Gesundheit der Lebenden festzustellen. Ein grüner Test ist wertvoller Beweis, aber es ist nicht die Erlaubnis, einen nicht beobachteten eingesetzten Wirkstoff als gesund zu behandeln.