2026-08-01T14:17:55.100Z
AI-Agent-Evaluierungsmetriken: Fünf Signale, keine zusammengesetzte Punktzahl
Verwenden Sie fünf explizite Nenner und harte Beweise-Tore, um Agent-Veröffentlichungen zu vergleichen, ohne falschen Erfolg, unbekannte Werkzeug-Effekte oder teure Fehler zu verbergen.
AI Agent Evaluierungsmetriken sollten eine Freisetzungsschrift beantworten, nicht ein Dashboard dekorieren. Für einen Werkzeugverwender ist eine kompakt vorgegebene Maßnahme fünf Messungen, die getrennt gehalten werden: Aufgabenqualität, nützlicher Fortschritt, Integrität der Werkzeugwirkung, Kosten pro überprüftes Ergebnis und falscher Erfolgsrate. Aufzeichnen Sie die Beweise neben jedem. Dann machen Sie die fehlenden Ergebnisse und unbekannten Werkzeug Effekte harte Toren, bevor Sie die Durchschnitte optimieren. Das ist wichtig. Ein Kandidat kann bessere Prosa schreiben, schneller fertig werden und billiger aussehen, während er ein unüberprüftes Ergebnis erstellt. Wenn man diese Signale in eine Punktzahl durchschnittlich macht, verwandelt sich eine unsichere Freisetzung in eine Zahlenverbesserung. Halten Sie fünf Nenner statt einer Punktzahl Die Agentenabschätzung hat mehrere Interessen. Anthropic's Engineering Guide zur Bewertung von Agenten unterscheidet Aufgaben, wiederholte Tests, Grader, Transkripte und den endgültigen Zustand der Umwelt. Das Beispiel für die Flugbuchung ist die nützliche Grenze: Die Überschrift kann sagen, dass ein Flug gebucht wurde, während das Ergebnis ist, ob die Reservierung in der Datenbank vorhanden ist. Die aktuelle Beschreibung der Vertex AI Agent Bewertung macht eine weitere Trennung. Bei der Bewertung der endgültigen Reaktion wird gefragt, ob der Agent das Ziel erreicht hat; Trajektoriemetriken überprüfen den Weg, einschließlich genauer oder ordnungsgemäßer Aktionsverhältnisse, Präzision, Rückruf und Einsatz eines einzigen Werkzeugs. Beide Ansichten sind nützlich, aber keiner sollte den anderen stillschweigend ersetzen. Verwenden Sie diesen fünfmetrischen Vertrag: Metriken Zähler Bezeichner Trennung Freistellungsrolle Qualität der Aufgaben Summe der versionierten Rubrik oder deterministischen Qualitätspunkte Versuche, für die der Qualitätsbewertungsbewerber tatsächlich gelaufen ist Grader Version, Abdeckung, Meinungsverschiedenheit Optimieren Sie nach Überschreitung der Beweise Nützliche Fortschritte Aktive Beobachtungsfenster mit einem Aufgabenspezifischen Beweisdelta Beobachtete aktive Fenster Ausdrückliche Wartefenster und veraltete Sammler Boden, dann optimieren Integrität der Werkzeugwirkung Externe Wirkungen, die am Bestimmungsort überprüft wurden Verifizierte + fehlgeschlagenen + unbekannten Wirkungsversuchen Absichtlich abgelehnt, unbekannte Auswirkungen Harter Boden Kosten pro geprüften Ergebnis Gesamtbetriebskosten Bestimmungsortgesteuerte Ergebnisse Schätzbare Kosten, fehlende Abrechnungsdeckung Haushaltsplan und Optimierung False Erfolgsrate Erklärte Fertigstellungen, deren Ergebnisprüfung nicht erfolgreich war Alle angemeldeten Fertigstellungen Abschlüsse, deren Überprüfer nicht verfügbar war Schweres Veto Jeder Nenner verhindert eine andere Lüge. Durchschnittliche Qualität ohne Graderschutz belohnt die einfachsten Beispiele. Der Erfolg des Tools ohne Bestimmungsnachweise verwechselt einen erfolgreichen Anruf mit einem erfolgreichen Effekt. Kosten pro Lauf belohnen billige Versagen. Die Abschlussrate belohnt einen Agenten für die Bewertung seines eigenen Anspruchs. Die operative Telemetrie gehört immer noch in das Hauptbuch. Das eingeklemmte OpenTelemetry GenAI Methriken Snapshot definiert Entwicklungsstatus Instrumente für Token Nutzung, Betriebsdauer, Agentendauer, Abschluss Anrufzahl, Werkzeug Anrufzahl und Werkzeugdauer. Diese Messungen erklären die Arbeitsbelastung und die Effizienz. Sie behaupten nicht, dass eine Akte existiert, eine Rechnung einmal erstellt wurde oder ein geplanter Bericht seinen Bestimmungsort erreicht hat. Schreiben Sie vor der Auswahl der Schwellenwerte die Evidenz auf Beginnen Sie mit einer Reihe pro Prozess. Beginnen Sie nicht mit einem Gesamtdiagramm. Eine minimale Aufzeichnung benötigt genug Informationen, um jeden Zähler, Nenner, Ausschluss und nicht verfügbaren Zustand zu reproduzieren: Der wichtige Wert ist nicht 0.90 ; es ist die Meinungsverschiedenheit um ihn herum. Der Reaktionsgrader mochte die Ausgabe, aber der Ergebnisprüfer war nicht verfügbar und der Werkzeugeffekt blieb unbekannt. Diese Studie kann Ihnen über die Reaktionsqualität beibringen. Sie kann einen Antrag auf Freilassung nicht unterstützen. Verwenden Sie drei Beweiszustände, wenn Abwesenheit möglich ist: verified bedeutet, dass das benannte Prädikat gegen den beabsichtigten Bestimmungsort lief und überschritten wurde. failed bedeutet, dass das Prädikat ausgeführt wurde und der erwartete Zustand fehlte oder inakzeptabel war. unavailable bedeutet, dass kein Urteil möglich war, weil der Überprüfer, der Sammler, die Genehmigung oder die Bestimmungsnachweise fehlten. Umwandeln Sie unavailable nicht in Null oder Erfolg. Null ist eine Messung; nicht verfügbar ist ein Abdeckungsfehler. Das Warten erfordert ähnliche Betreuung. Ein Lauf mit einem ausdrücklichen Genehmigungsbesitzer, der angeforderten Entscheidung, der Frist und dem Status der Wiederaufnahme ist nicht fest. Berechnen Sie die nützlichen Fortschritte während der aktiven Fenster vor der Wartezeit und stoppen Sie dann die aktive Progressuhr. Halten Sie den abgelehnten High impact Tool Aufruf als Beweis dafür, dass die Grenze funktioniert hat; zählen Sie eine absichtliche Ablehnung nicht als Ausfall des Tools. Die Qualität der Aufgaben ist die einzige Metrik, die wahrscheinlich mehrere Gradertypen benötigt. Verwenden Sie deterministische Tests für strukturierte Felder, Dateien, Datenbankzeilen, HTTP Status und genaue Richtlinienbedingungen. Ein Modellgraderer kann Ton, Relevanz oder ein offenes Artefakt bewerten, speichert aber seine Anforderung, Modell, Rubrikversion und Kalibrierungsprobe. Eine menschliche Überprüfung ist immer noch notwendig, wenn das Urteil Konsequenzen hat oder die Meinungsverschiedenheitsrate des Modellgraders nicht verstanden wird. Reproduzieren Sie die Freisetzung umgekehrt Das mit diesem Artikel behaltenes Artefakt enthält zehn synthetische Tests: fünf für stable v1 und fünf für fast v2 . Führen Sie es mit Node.js 20 oder neuer aus: Die angegebenen Schwellenwerte sind: Die genaue Zusammenfassung lautet: Variante Qualität Nützliche Fortschritte Überprüfte Werkzeugwirkung Kosten / Betrieb Kosten / bestätigte Ergebnisse Falscher Erfolg Unüberprüfte Vollständigkeit Tor : : : : : : : stable v1 0.818 (4/4) 14/14 5/5 $0.41 $0.52 0/4 0 Pass fast v2 0.902 (5/5) 15/16 4/5 $0.38 $0.63 1/5 1 Versagen Drei Beobachtungen ändern die Entscheidung. Zuerst sieht fast v2 billiger aus, wenn der Nenner läuft: 0,38 Dollar anstelle von 0,41 Dollar. Sobald die Ausgaben nach den nachgewiesenen Ergebnissen geteilt werden, kehrt die Schlussfolgerung um: 0,63 Dollar anstelle von 0,52 Dollar. Die schnellere Version kostet weniger für jeden Versuch und mehr für jedes Ergebnis, dem man vertrauen kann. Zweitens ist die höhere Qualitätspunktzahl von 0,902 kein fehlendes Ergebnis wiederherzustellen. Eine polierte Fertigstellung versagte die Umweltprüfung; eine andere hatte keinen verwendbaren Verifikator. Qualitäts und nützliche Fortschrittsdurchschnitte bleiben diagnostisch, aber sie sind nicht die Autorität, um eine äußere Wirkung zu veröffentlichen, zu bezahlen, zu berichten, zu löschen oder anderweitig zu akzeptieren. Drittens enthält stable v1 eine rechtmäßige Genehmigungswartung. Es ist nicht in der Qualitätsbenennung für den abgeschlossenen Probe enthalten, aber die Fortschritte vor der Wartezeit und der absichtlich abgelehnte Tool Call bleiben sichtbar. Der metrische Vertrag belohnt weder den Abschluss Theater noch bestraft eine korrekte Pause. Dieses Experiment ist ein Gegenbeispiel, kein Maßstab. Die Preise, Prüfungen und Schwellenwerte werden konstruiert, um die Rechnungslegungsregel zu prüfen. Sie schätzen keine falsche Produktionserfolgsquote an, und $0.60 ist kein universeller Haushalt. Gate Beweise vor der Optimierung der Qualität Die Metriken werden in einer festen Reihenfolge angewendet: 1. Check Coverage. Jede erklärte Fertigstellung benötigt ein Ergebnisurteil oder einen ausdrücklichen nicht verfügbaren Zustand. Jeder Versuch mit wirkungsfähigen Werkzeugen erfordert verifizierte, fehlgeschlagene oder unbekannte Bestimmungsbeweise. 2. Block falscher Erfolg. Wenn eine erklärte Fertigstellung ihre Ergebnisprüfung versagt hat, stoppen Sie die Freisetzung. Untersuchen Sie den Abschlusspredikat, nicht den Reaktionsstil. 3. Block Unbekannte Effekte. Eine unbekannte Nebenwirkung ist eine Zwischengrenze. Frag die Bestimmung an oder vergleiche einen Idempotency Schlüssel, bevor du erneut versuchst. 4. Überprüfen Sie den Fortschritt und die Werkzeugböden. Vergleichen Sie ähnliche Aufgaben und bewahren Sie gültige Wartezeiten. Eine Fortschrittsregression oder eine fehlerhafte Werkzeug Effektrate kann einen Rückgang rechtfertigen, auch wenn die endgültige Qualität steigt. 5. OOptimieren Sie Qualität und Kosten. Nur jetzt vergleichen Sie Rubrikenscore, Latenz, Token und Kosten pro überprüften Ergebnis. Das ist absichtlich kein gewichteter Zusammensatz. Gewichte fordern Verhandlungen zwischen unabhängigen Schäden auf: genügend Flüssigkeit kann eine doppelte Zahlung mathematisch stornieren; genügend billige Runden können einen fehlenden Bericht verbergen. Eine Politik kann immer noch Gewichte innerhalb der Aufgabenqualitätsrubrik verwenden, aber die Belege und die externen Auswirkungen bleiben außerhalb dieser Punktzahl. Wählen Sie Schwellenwerte aus den Folgen des Workflows und der Ausgangslinie aus. Ein Lese Nur Forschungsagent kann einen niedrigeren Werkzeug Effekt Boden tolerieren, weil die meisten Anrufe reversibel sind. Eine Veröffentlichung, eine Abrechnung, eine Kundennmeldung oder ein Zugangskontrollagent sollte für die abgedeckte Testsammlung Bestimmungsbewilligungen, eine Ausfallfähigkeit und ein Null Falsch Erfolgsziel erfordern. Berichten Sie über Vertrauenintervalle, wenn die Testzahl groß genug ist, und zeigen Sie die Rohzahl, wenn sie nicht ist. Fünf Studien sind 0/5 , kein Beweis für eine Null Population Fehlerrate. Halten Sie die Bewertung und die Produktion zusammen, aber unterschiedlich. Offline Tests zeigen, ob ein Kandidat bekannte Szenarien überlebt. Die Überwachung der Produktion zeigt Ihnen, ob echte Zeitpläne, Anmeldeinformationen, Abhängigkeiten, Kosten und Ergebnisse nach der Veröffentlichung gesund bleiben. Eine Passing Suite ist die Erlaubnis, innerhalb des angegebenen Umfangs eingesetzt zu werden, nicht der Beweis, dass zukünftige Laufungen nicht fehlgeschlagen werden können. Die Produktrichtung von Sidewisp ist es, Ergebnisse, Fortschritte, Werkzeuge, Verfügbarkeit, Speicher und Kostenbeweise in eine gesundheitliche Sicht um bestehende Agentenlaufzeiten zu bringen. Es handelt sich nicht um eine Ersatzlaufzeit, ein obligatorisches Gateway oder einen autonomen Fixer. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Die öffentliche Website und Artikelbibliothek sind live; Produktion Agent Gesundheit Sammlung, Laufzeit Adapter, Token Kosten Analysen und Wiederherstellung Ausführung werden im Allgemeinen nicht versendet. Verwenden Sie zuerst den fünfmetrischen Vertrag für einen konsequenten Workflow. Wenn die Version mit dem am besten aussehenden Durchschnitt immer noch ein Ergebnis oder Werkzeug Effekt Gate fehlt, haben die Messwerte ihre Arbeit getan.