2026-08-01T11:10:47.800Z
Zuverlässigkeit des AI-Agenten: Prüfung der Beweise
Verwandeln Sie die zwölf Metriken des Papiers in ein überprüfbares Beweisprofil, und fügen Sie dann die Live-Gesundheitsrechnungen hinzu, die eine Entsendungsentscheidung noch braucht.
Die kurze operative Lesung von Wor a Science of AI Agent Reliability lautet: Halten Sie das Papier s vierdimensionalen Profil, aber akzeptieren Sie niemals eine Reihe von zwölf Punkten ohne die Beweise, die sie erzeugten. Für eine Entsendungsentscheidung ist auch ein aktueller Nachweis der Reichbarkeit, der erwarteten Laufzeit, der eigenen Wartezeiten, der Werkzeugeffekte und der Zielergebnisse hinzuzufügen. Ein Benchmark Profil und ein Live Gesundheitsurteil beziehen sich auf unterschiedliche Fragen. Die Juni 2026 arXiv v3 Papier von Stephan Rabanser und Kollegen misst die Zuverlässigkeit unabhängig von der Roharbeitsgenauigkeit. Es bewertet 15 Modelle auf GAIA und einer gereinigten Untermenge von τ Bänken und zerlegt dann die Zuverlässigkeit in Konsistenz, Robustheit, Vorhersehbarkeit und Sicherheit. Das Ergebnis der Autoren ist bewusst unangenehm: Fähigkeitsgewinne über das untersuchte Freigabefenster ergaben nicht automatisch vergleichbare Zuverlässigkeitsgewinne. Das ist für einen Betreiber nützlich, aber erst nach der Übersetzung jeder Metrik in einen Beweisvertrag. Die nachstehende Checkliste führt diese Übersetzung durch und macht die restlichen Produktionsgrenzen explizit. Lesen Sie die zwölf Metriken als Beweisantrag Die Tabelle 2 des Papiers enthält zwölf Metriken. Es handelt sich nicht um zwölf austauschbare Qualitätspunkte. Dimension Papiermetriken Mindestbeweise zur Aufbewahrung Konsistenz Ergebnis; Streckenverteilung; Streckenfolge; Ressourcennutzung Task Set Version, unabhängige Ausführungszählung, Ergebnisorakel, Aktionssequenzen, Ressourcen Einheiten und jede Aufzeichnung pro Ausführung Robustheit Fehler; Umgebung; Notfall Ausgangsversuche, gepaarte Störungsversuche, eine versionerte Störungsspezifikation und Nachweis, dass die Umgebung oder die sofortige Veränderung die Bedeutung der Aufgabe erhalten hat Vorhersehbarkeit Kalibrierung; Diskriminierung/AUROC; Brier Vertrauen, das vor der Bewertung erfasst wurde, Hinweise auf binäre Ergebnisse, Binning oder Ranking Methode, Stichprobenzahlung und Quelle des Vertrauens Sicherheit Konformität; Schadensschwere Versionsbeschränkungen, jede Verletzung, Schweregeln, Richteridentität und Version und eine menschliche Validierung Die erste Betriebsregel ist daher einfach: a Metrik ohne Nenner, Protokoll und Beweisstandort ist nicht verfügbar, nicht niedrig und nicht gesund . Betrachten Sie die Konsequenz des Ergebnisses. Wenn man fünfmal vierzig Aufgaben erneut ausführt, werden 200 Versuche durchgeführt, aber eine Punktzahl allein sagt nicht, ob die gleichen Aufgaben zwischen Erfolg und Misserfolg abwechseln oder ob jedes Mal eine feste Untermenge scheitert. Diese Muster können eine ähnliche durchschnittliche Genauigkeit und sehr unterschiedliche Betriebseffekte haben. Die Metrik des Papiers existiert, um diese Unterscheidung zu enthüllen; die Abwerfung der Beweise auf Versuchsebene würde das Problem, das sie löst, neu erschaffen. Die Robustkeitsmessungen brauchen noch mehr Sorgfalt. Eine Fehler Injektions Score ist nur im Vergleich zu einer Ausgangslinie interpretierbar. Eine Prompten Rohmheit Score ist nur gültig, wenn die Varianten semantisch gleichwertig bleiben. Die Umbenennung eines JSON Feldes kann die Schwachheit der Umwelt testen; die Entfernung der Informationen, die zur Lösung der Aufgabe erforderlich sind, ändert die Aufgabe. Speichern Sie den Störungsgenerator, seine Version und eine überprüfte Probe neben dem Ergebnis. Die Vorhersehbarkeit erfordert einen ähnlich strengen Zeitstempel. Ergreifen Sie das Vertrauen, bevor der Ausgangsgrader läuft. Das Vertrauen, das geschrieben wird, nachdem ein Agent ein Testresultat gesehen hat, ist keine Prognose. Erfassen Sie auch, ob der Wert von dem Agenten, einem separaten Modell, einem kalibrierten Klassifikator oder einer Heuristik stammt. Kalibrierung, AUROC und Brier Score können alle aus dem falschen Vertrauenssignal richtig berechnet werden. Schließlich soll die Sicherheitsgrenze des Papiers bewahrt werden. Die öffentliche Methodik meldet die Sicherheit getrennt vom Gesamtzuverlässigkeitsscore. Das ist der richtige Standard für Operationen. Eine starke Konsistenz Score darf eine nicht autorisierte Zerstörung nicht durchschnittlich abschneiden. Die Konformitätsmessungen zeigen, wie oft die Beschränkungen eingehalten wurden; die Schwere der bedingten Schäden stellt die Frage, wie schwer die Verstöße waren. Du brauchst sowohl die Frequenz als auch den Schwanz. Das Profil wird vor der Debatte über Schwellenwerte verlegt. Schwellenargumente sind vorzeitig, wenn das Beweispaket unvollständig ist. Ich habe einen kleinen Profil Linter gebaut, der zuerst die Struktur überprüft: alle zwölf benannten Metriken existieren; jede Metrik hat eine Punktzahl, einen Zähler, einen Nenner, ein Protokoll und eine Beweis URI; Die Ergebnisse der Robustheit umfassen paare Ausgangs und Störungszahlen sowie eine veränderte Spezifikation; die Ergebnisse der Vorhersehbarkeit identifizieren die Vertrauensquelle; Sicherheitsergebnisse ermitteln Einschränkungen und Beurteilungsmethode; die Sicherheit ist nicht in den Gesamtwert der Zuverlässigkeit eingegliedert; eine autonome Einführung enthält eine nicht leere vom Menschen validierte Sicherheitsprobe. Anschließend überprüft sie sechs Beweise für die Gesundheit: Frische, Reichweite, Zeitplandeckung, Wartebesitz, Werkzeug Effekt Rechnungen und Ziel Ergebnis Rechnungen. Das dargestellte illustrative Profil enthält alle zwölf Papiermessungen und eine Überprüfung der menschlichen Sicherheit von 30 Fällen. Das Ergebnis ist immer noch: Die beiden Blockers fehlen Quittungen für Werkzeug Effekt und Ziel Ergebnis. Der Lintertest liefert dann diese beiden Beweisreferenzen und ändert das Ergebnis in PASS . Das beweist nicht, dass der fiktive Agent sicher ist; es beweist, dass das Beweismaterial vollständig genug ist, um es zu überprüfen. Die Unterscheidung zählt. Durchführung der Prüfung mit: Das ist ein absichtlich bescheidenes Artefakt. Es bestätigt Präsenz und Form, nicht wissenschaftliche Gültigkeit. Sie kann nicht entscheiden, ob ein Benchmark Ihre Benutzer repräsentiert, ob ein Vertrauensbericht ehrlich ist, ob zwei Anfragen das gleiche bedeuten oder ob ein LLM Richter den Schaden korrekt eingestuft hat. Diese bleiben Aufgaben der Domänenüberprüfung. Verwandeln Sie das Profil nicht in eine Freigabenummer Das Papier berechnet Dimensionaggregate, um den Vergleich zu unterstützen, aber seine eigenen Entscheidungen zeigen, warum die Betreiber das Profil sichtbar halten sollten. Die Gesamtzuverlässigkeitsaggregat kombiniert Konsistenz, Vorhersehbarkeit und Robustheit; Sicherheit bleibt getrennt. In dem Papier werden auch wichtige Grenzen angegeben: Zwei Benchmarks decken nur einen engen Aufgabenstück ab, pro Benchmark wird ein Gerüst verwendet, die Sicherheitsbewertung hängt von einem LLM Rechner ab, die Wahl von Metriken und Aggregation ist subjektiv und die Nulltemperatur kann die zur Maximierung der Genauigkeit gewählte Zuverlässigkeit überschätzen. Diese Grenzwerte sollten neben einer Entsendungsentscheidung und nicht in einer archivierten Methodik aufgeführt werden. Eine praktische Überprüfung kann in drei Ebenen durchgeführt werden: 1. Profilvollständigkeit: Sind die zwölf Metriken durch überprüfbare Beweise unterstützt? 2. Anwendungsschwellen: Welche Abmessungen und Schwanzbedingungen sind für diese Aufgabe und für diese Behörde akzeptabel? 3. OBestätigungen: Ist das derzeit eingesetzte System erreichbar, entwickelt sich, begrenzt und erzielt das beabsichtigte externe Ergebnis? Die zweite Schicht ist notwendigerweise anwendungsspezifisch. Ein Entwurfsschreibassistent mit obligatorischer menschlicher Überprüfung kann eine andere Inkonsistenz als ein unüberwachter Rückerstattungsagent tolerieren. Das Papier macht den gleichen allgemeinen Punkt: Zuverlässigkeitsanforderungen sollten mit Autonomie skaliert werden. Vermeiden Sie es, eine Punktzahl des Rankings in eine universelle Freigabe zu kopieren. Für Folgewirkungen verwenden Sie das Veto vor Durchschnittswerte. Eine vernünftige lokale Politik ist: Diese Ordnung hält attraktive Durchschnitte vor unbekannten oder schweren Zuständen zu verbergen. Hinzufügen der Produktionsnachweise, für die das Papier keine Messung behauptet Ein Benchmark bewertet das Verhalten nach einem definierten Protokoll. Ein Betreiber muss auch wissen, was jetzt passiert. Fügen Sie diese sechs Quittungen hinzu, ohne vorzugeben, dass sie zusätzliche Papier Metriken sind: EFrische der Beweise: , wenn jedes Gesundheitssignal zuletzt überprüft wurde und wann es abläuft. Reichweite: ob die Laufzeit und die erforderlichen Werkzeuge jetzt kontaktiert werden können. Abdeckung: , bei denen erwartete Laufungen begonnen, abgeschlossen, überlappend oder verpasst wurden. Warte Eigentum: ob eine legitime Abhängigkeit einen Eigentümer, Frist und Wiederaufnahmezustand hat. Toll Effekt Vergleich: ob eine ausgelaufene oder erneut geprüfte Aktion sein Ziel Null , ein oder mehrfach geändert hat. Destinationsergebnisüberprüfung: ob die versprochene Datei, Datenbankänderung, Nachricht, Testresultat oder andere Liefermittel vorhanden sind und ihre Akzeptanzregel erfüllen. Diese Ergänzung verhindert zwei Kategorienfehler. Erstens beweisen wiederholte Erfolge bei den Benchmark Analysen nicht, dass eine Produktionslaufzeit derzeit erreichbar ist. Zweitens beweist ein erfolgreicher Kommando oder Modellreaktion nicht, dass der äußere Effekt oder das Lieferbare existiert. Die von der Projektstelle verlinkte HAL Harness Repository ist hier hilfreich, da sie auf reproduzierbare Bewertungen, Spuren, Isolation und Kostenverfolgung hinweist. Das sind starke Evaluierungsinputs. Sie benötigen immer noch ein Einsatz spezifisches Ergebnisorakel und aktuelle Betriebsergebnisse, wenn der Agent außerhalb des Benchmarks agiert. Verwenden Sie das Papier als Profil, nicht als Genehmigungsblatt. Für eine echte Überprüfung, fangen Sie mit einem Arbeitsfluss an, anstatt mit einer ganzen Flotte: 1. Pin die Laufzeit, das Modell, das Gerüst Commit, die Werkzeugversionen, die Task Set Version und das Evaluierungsdatum. 2. Wiederholte nominelle Tests durchführen und Ergebnisse, Strecken und Ressourcenregister speichern. 3. Definieren Sie Fehler, Umgebung und schnelle Störungen, bevor Sie das Ergebnis untersuchen. 4. Ergreifen Sie das Selbstvertrauen, bevor Sie die Bewertung machen. 5. Definition von Einschränkungen und Schweregrad; menschliche Validierung einer Sicherheitsprobe. 6. Halten Sie die Sicherheit von dem Aggregat getrennt. 7. Fügen Sie die sechs Beweise für lebende Gesundheit an. 8. Aufzeichnen Sie unknown , wo Beweise fehlen. 9. Stellen Sie Schwellenwerte und Veto für die Autorität und Konsequenzen dieses Workflows fest. 10. Das Profil wird nach Materialmodell , Prompts , Gerüst , Werkzeug oder Umgebungsänderungen erneut ausgeführt. Dies bewahrt den wichtigsten Beitrag des Papiers: Zuverlässigkeit ist eine Form, nicht ein Synonym für Genauigkeit. Es verhindert auch, dass diese Form zu einem dekorativen Dashboard wird. Das beobachtbare Ergebnis der Überprüfung ist nicht ein Zuverlässigkeitsscore wurde berechnet. Es handelt sich um eine versionalisierte Entscheidung mit überprüfbaren Beweisen, expliziten Unbekannten und einer klaren Liste dessen, was überprüft werden muss, bevor die Behörde erweitert wird. Sidewisps beabsichtigtes Gebiet ist die operative Seite dieser Grenze: Reichbarkeit, nützliche Fortschritte, Kontext, Werkzeuge, Ergebnisse und Kosten rund um Agenten, die bereits anderswo ausgeführt werden. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Seine Produktionsüberwachungsadapter und Wiederherstellungssysteme werden im Allgemeinen nicht versandt, daher beschreibt dieser Artikel eine Betriebsmethode, nicht eine aktuelle automatisierte Sidewisp Fähigkeit. Wenn diese Beweisgrenze den Fehlern entspricht, die Sie fangen müssen, können Sie sich der privaten Vorschau von der Sidewisp Website anschließen. Quellen Rabanser et al., Während einer Wissenschaft der AI Agentenzuverlässigkeit, arXiv v3, Juni 2026 Holistische Mittel Leaderboard Zuverlässigkeitsmethodik HAL reproduzierbares Bewertungsgerät ICML 2026 Posterseite OpenReview Aufzeichnung