2026-07-31T18:17:11.392Z
KI-Voice-Agent-Tests: Beweisen Sie, dass der Anruf funktioniert hat
Ein Fünf-Gate-Voice-Agent-Test für Verbindung, Turn-Timing, Einmarsch, Werkzeugeffekte und das verifizierte Ergebnis des Anrufers.
Das Testen von KI Sprachagenten sollte eine Veröffentlichung nicht bestehen, da das Transkript plausibel klingt. Ein vertretbarer Test beweist fünf verschiedene Dinge: Der Anruf wurde verbunden, der Agent hat innerhalb eines Workflow spezifischen Limits geantwortet, die Unterbrechung hat die Audioausgabe des Assistenten tatsächlich gestoppt, jedes Tool mit Nebeneffekten hat ein bekanntes Ergebnis erzielt und das vom Anrufer gewünschte Ergebnis existiert außerhalb des Gesprächs. Diese Unterscheidung ist wichtig, weil die üblichen Artefakte engere Fragen beantworten. Eine Aufnahme beweist, dass Audio vorhanden war. Ein Transkript beweist, dass die Spracherkennung Text erzeugt hat. Eine LLM Rubrik schätzt, ob dieser Text ein Kriterium erfüllt. Ein Terminal Telefoniestatus beweist, dass der Anruf beendet wurde. Keine dieser Tatsachen allein beweist, dass ein Termin gebucht, eine Stornierung vorgenommen wurde oder ein Transfer sein Ziel erreicht hat. Die praktische Standardeinstellung besteht darin, den Simulator und den Transkriptauswerter beizubehalten und dann eine kleine deterministische Anrufbestätigung daneben hinzuzufügen. Ein fließendes Transkript besteht nur aus einer Ebene Sprachsimulation ist nützlich. Vapi ist aktuell Dokumentation von Sprachtests beschreibt einen echten Telefonanruf zwischen dem Zielagenten und einem Testagenten, gefolgt von der Aufzeichnung, Transkription und LLM Bewertung anhand einer Rubrik. Das übt weit mehr aus als ein reiner Text Prompttest. Es hinterlässt immer noch erkennbare Lücken. In einem Transkript kann die genaue Grenze zwischen dem Ende des Anrufers und dem Beginn der Audiowiedergabe weggelassen werden. Es kann sauber gelesen werden, nachdem der Anrufer mit dem Assistenten gesprochen hat. Es kann die sichere Bestätigung eines Tools enthalten, selbst wenn das Remote System eine Zeitüberschreitung erlitten hat. Der Begriff „Telefonie Vervollständigung“ hat eine ähnlich enge Bedeutung. Twilio Dokumente queued , ringing , in progress , completed , busy , failed , no answer , Und canceled Anrufzustände. Es ist Ressourcenreferenz aufrufen warnt auch davor completed bedeutet, dass eine Verbindung hergestellt und Audio übertragen wurde. Möglicherweise hat eine Person, ein IVR oder eine Voicemail geantwortet. „Abgeschlossen“ ist daher ein Transportbeweis, kein Geschäftsurteil. Verwenden Sie stattdessen fünf Tore: Tor Mindestbeweise Ein Fehler, den es aufdeckt Erreichbarkeit Korrelierte Anruf ID plus verbundene oder in progress Status Warteschlange, keine Antwort, ungültiges Ziel Wendezeitpunkt Benutzeraudio wurde bei t1 gestoppt; Assistent Audio begann bei t2 Langsame Reaktion, verdeckt durch ein kohärentes Transkript Unterbrechung Benutzerunterbrechung bei t3 ; Assistenten Audio gestoppt durch t4 Der Agent spricht weiterhin über den Anrufer Werkzeugeffekt Stabile Vorgangs ID plus Empfangsbestätigung Timeout, gefolgt von einem unsicheren blinden Wiederholungsversuch Ergebnis Unabhängige Prüfung des versprochenen Ergebnisses Normales Gesprächsende ohne Buchung, Weiterleitung oder Stornierung Fassen Sie diese zunächst nicht zu einer Partitur zusammen. Ein gewichteter Durchschnitt kann dazu führen, dass ein hervorragendes Transkript ein fehlendes Ergebnis verbirgt. Halten Sie die fehlerhafte Ebene sichtbar. Zeichnen Sie Audiogrenzen auf, nicht nur die Modelllatenz Das nützliche Erstreaktionsintervall beginnt, wenn die Audioaufnahme des Anrufers als abgeschlossen betrachtet wird, und endet, wenn die Audiowiedergabe des Assistenten tatsächlich beginnt: Das ist nicht dasselbe wie die Modellzeit bis zum ersten Token. Sprachendpunktierung, Transkription, Modellinferenz, Synthese, Pufferung und Telefontransport sind alle Teil der Erfahrung des Anrufers. Die Messung nur einer internen Phase kann dazu führen, dass ein langsamer Anruf gesund aussieht. Eine Unterbrechung erfordert eine weitere gepaarte Beobachtung: Vapis Dokumentation von Serverereignissen stellt separate Statusaktualisierungen, Sprachaktualisierungen und user interrupted , Werkzeugaufruf und Aufrufende Ereignisse. Es wird darauf hingewiesen, dass eine Unterbrechung mit Beweisen für einen Sprachstopp einhergehen kann. Andere Anbieter verwenden andere Namen, aber der Vertrag ist portierbar: Behalten Sie eine Anruf ID, eine Turn ID, sofern verfügbar, monotone Zeitstempel, einen Ereignistyp und einen kleinen Satz nicht inhaltsbezogener Felder bei. Für beide Intervalle gibt es keinen universell guten Wert. Das ausführbare Fixture, das für diese Artikelsätze verwendet wird maxFirstResponseMs bis 1200 und maxInterruptStopMs auf 300, sodass die Entscheidungsregel überprüfbar ist. Dabei handelt es sich um beispielhafte politische Werte, nicht um Branchenstandards. Kalibrieren Sie mit realen Netzwerkpfaden, Sprachen, Sprechstilen, Zugänglichkeitsanforderungen und den Kosten eines falschen Fehlers. Ein Freigabetest soll zudem die Unsicherheit bewahren. Wenn „user speech stop“ fehlt, berechnen Sie die Latenz nicht anhand eines Transkript Zeitstempels. Wenn das Unterbrechungsereignis vorhanden ist, Assistant Stop jedoch nicht, kehren Sie zurück barge in failed oder insufficient evidence gemäß Inkassovertrag. Erstellen Sie niemals ein gesundes Intervall aus unvollständigen Ereignissen. Wiederholen Sie eine Fehlerpriorität, bevor Sie Live Anrufe testen Das Begleitartefakt enthält acht inhaltsfreie Anrufströme. Jedes Ereignis hat einen relativen Zeitstempel und nur die für die Klassifizierung erforderlichen Felder: Führen Sie es aus mit: Das durchgeführte Spiel ergab in acht Urteilen exakt die erwartete Parität: Vorrang ist wichtig. Prüfen Sie die Erreichbarkeit vor der Zeiteinteilung, da es bei einem unbeantworteten Anruf keine aussagekräftige erste Antwort geben kann. Überprüfen Sie den Zeitpunkt und die Unterbrechung, bevor das Tool Auswirkungen hat, da ein Anrufer möglicherweise bereits eine unterbrochene Interaktion erlebt hat. Gleichen Sie den Werkzeugeffekt ab, bevor Sie die Terminalvervollständigung bewerten, da der erneute Versuch eines ungewissen Nebeneffekts zu doppelter Arbeit führen kann. Fordern Sie das Ergebnis zuletzt auf, weil es die stärkste Behauptung ist. Bei dieser Reihenfolge handelt es sich um eine Betriebsregel, nicht um eine Einstufung des Schweregrads. Ein fehlgeschlagener Abbruch kann größere Auswirkungen haben als langsamer Ton. Leiten Sie den Schweregrad aus dem Workflow und die Benutzerkonsequenz weiter, nachdem die Beweisebene bekannt ist. Bewahren Sie den Werkzeugbeleg getrennt vom Ergebnisbeleg auf Ein Sprachagent ruft häufig ein Planungs , Zahlungs , Ticket oder Überweisungstool auf. Das Werkzeugergebnis des Modells ist nicht unbedingt der dauerhafte Zustand des Ziels. Geben Sie jedem Versuch mit Nebenwirkung eine stabile Operations ID. Behalten Sie die angeforderte Aktion, Zielklasse, Versuchsnummer, Antwortklasse und eine inhaltsfreie Effektprüfung bei. Wenn beim Transport nach der Übermittlung eine Zeitüberschreitung auftritt, stimmen Sie diese Vorgangs ID ab, bevor Sie es erneut versuchen. Eine zweite Anfrage mit einer neuen Identität kann zu einem doppelten Termin oder einer doppelten Stornierung führen. Überprüfen Sie dann selbstständig das versprochene Ergebnis des Anrufers. Ein Tool Effekt kann real sein, während das Benutzerergebnis noch falsch ist: Ein Termin existiert unter dem falschen Konto, eine Überweisung ist mit einem IVR anstelle eines Operators verbunden oder eine Stornierung hat einen Artikel geändert, während das angeforderte Paket aktiv bleibt. Das Gerät false complete Der Fall ist bewusst unpraktisch. Es verfügt über einen verbundenen Anruf, eine erste Antwort von 600 ms, einen verifizierten Tool Effect Empfang und einen abgeschlossenen Anrufstatus. Es schlägt immer noch fehl, weil outcome.verified fehlt. Das ist genau der Fall, den ein Nur Transkript Gate wahrscheinlich übersehen wird. Ein LLM Evaluator bleibt für Qualitäten nützlich, die schwer deterministisch zu kodieren sind: ob der Agent Frustration eingestanden hat, eine Richtlinie klar erklärt hat oder einem Interaktionsstil gefolgt ist. Behalten Sie das Urteil mit der Transkriptauswertungsebene bei. Lassen Sie nicht zu, dass Erreichbarkeit, Zeitstempel, Zielbestätigungen oder externer Status überschrieben werden. Versenden Sie den kleinsten, datenschutzsicheren Beleg Der Klassifikator benötigt weder Anruferaudio noch Transkripttext. Eine minimale Quittung kann pseudonyme Anruf und Turn IDs, relative Zeitstempel, Ereignistypen, Terminalstatus, gehashte Richtlinienversion, Vorgangs ID sowie boolesche Effekt und Ergebnisergebnisse enthalten. Bewahren Sie Aufzeichnungen nur auf, wenn Einwilligung, Aufbewahrungsrichtlinie und Debugging Wert dies rechtfertigen. Führen Sie vor der Veröffentlichung die feste Vorrichtung aus, um den Klassifikator selbst zu testen. Führen Sie dann eine kleine Reihe echter Anrufe über die relevanten Mobilfunkanbieter, Regionen, Sprachen und Anruferverhalten durch. Überprüfen Sie die Schwellenwertverteilungen, anstatt sich auf einen einzigen Laborbesuch zu konzentrieren. Abschließend können Sie Produktionsausfälle als neue Regressionsfälle wiedergeben, ohne vertrauliche Konversationsinhalte in die Testsuite zu kopieren. Die Einschränkung ist klar: Dieses Artefakt validiert eine Entscheidungsregel, nicht die Qualität der Spracherkennung oder die Betriebszeit eines Anbieters. Es können keine Schwellenwerte für Ihre Anrufer festgelegt werden. Es verhindert jedoch, dass ein ausgefeiltes Gespräch mit verifizierter Arbeit verwechselt wird. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Das öffentliche Erlebnis besteht aus einer Early Access Website und einer interaktiven Demonstration. Die Erfassung und Wiederherstellung des Zustands des Produktionsagenten ist nicht im aktuellen Website Repository enthalten. Die Produktausrichtung ist eine Gesundheitsschicht rund um bestehende Laufzeiten, keine Sprachplattform, kein Telefonanbieter oder autonomer Fixer. Wenn dieser Fünf Tor Beleg mit den Fehlern übereinstimmt, die Sie abfangen müssen, können Sie dies tun Nehmen Sie an der privaten Vorschau von Sidewisp teil und beschreiben Sie die von Ihnen betriebene Sprachagenten Laufzeitumgebung.