2026-07-31T18:16:59.355Z
Pruebas de agentes de voz con IA: demuestre que la llamada funcionó
Una prueba de agente de voz de cinco puertas para conexión, sincronización de turnos, irrupción, efectos de herramientas y resultado verificado de la persona que llama.
Las pruebas de agentes de voz de IA no deberían aprobar una versión porque la transcripción parece plausible. Una prueba defendible demuestra cinco cosas distintas: la llamada se conectó, el agente respondió dentro de un límite específico del flujo de trabajo, la interrupción realmente detuvo el audio del asistente, cada herramienta de efectos secundarios alcanzó un resultado conocido y el resultado solicitado por la persona que llama existe fuera de la conversación. Esa distinción es importante porque los artefactos habituales responden a preguntas más específicas. Una grabación prueba que existía el audio. Una transcripción demuestra que el reconocimiento de voz produjo texto. Una rúbrica de LLM estima si ese texto cumplió con un criterio. El estado de telefonía del terminal prueba que la llamada finalizó. Ninguno de estos hechos prueba por sí solo que se haya reservado una cita, que se haya aplicado una cancelación o que un traslado haya llegado a su destino. Lo práctico por defecto es conservar el simulador y el evaluador de expedientes académicos y luego agregar un pequeño recibo de llamada determinista al lado de ellos. Una transcripción fluida es solo una capa La simulación de voz es útil. La corriente de Vapi documentación de prueba de voz describe una llamada telefónica real entre el agente objetivo y un agente de prueba, seguida de grabación, transcripción y evaluación de LLM según una rúbrica. Esto abarca mucho más del camino que una prueba de sólo texto. Todavía deja lagunas observables. Una transcripción puede omitir el límite exacto entre la finalización de la llamada y el inicio de la reproducción de audio. Puede leerse claramente después de que la persona que llama habló con el asistente. Puede contener la confirmación segura de una herramienta incluso cuando se agotó el tiempo de espera del sistema remoto. La finalización de la telefonía tiene un significado igualmente limitado. Documentos de Twilio queued , ringing , in progress , completed , busy , failed , no answer , y canceled llamar estados. Es Referencia de recursos de llamada también advierte que completed significa que se estableció una conexión y se transfirió el audio. Es posible que haya respondido una persona, un IVR o un correo de voz. Por lo tanto, "completado" es una prueba de transporte, no un veredicto comercial. Utilice cinco puertas en su lugar: Puerta Evidencia mínima Un fracaso que expone Accesibilidad ID de llamada correlacionada más conexión o in progress estado Cola, sin respuesta, destino no válido Sincronización de giro El audio del usuario se detuvo en t1 ; El audio del asistente comenzó en t2 Respuesta lenta oculta por una transcripción coherente. Interrupción Interrupción del usuario en t3 ; audio del asistente detenido por t4 El agente continúa hablando por encima de la persona que llama. Efecto de herramienta ID de operación estable más recibo de destino Tiempo de espera seguido de un reintento ciego inseguro Resultado Comprobación independiente del resultado prometido. Fin de llamada normal sin reserva, transferencia o cancelación No los combine en una sola partitura al principio. Un promedio ponderado puede permitir que una transcripción excelente oculte un resultado faltante. Mantenga visible la capa fallida. Grabe límites de audio, no solo latencia del modelo El útil intervalo de primera respuesta comienza cuando el audio de la persona que llama se considera completo y finaliza cuando el audio del asistente realmente comienza a reproducirse: Eso no es lo mismo que el modelo de tiempo hasta el primer token. La localización del habla, la transcripción, la inferencia de modelos, la síntesis, el almacenamiento en búfer y el transporte telefónico se encuentran dentro de la experiencia de la persona que llama. Medir solo una etapa interna puede hacer que una llamada lenta parezca saludable. La interrupción necesita otra observación emparejada: Vapi's documentación de eventos del servidor expone actualizaciones de estado separadas, actualizaciones de voz, user interrupted eventos de llamada de herramienta y de fin de llamada. Señala que la interrupción puede combinarse con evidencia de interrupción del discurso. Otros proveedores usan nombres diferentes, pero el contrato es portátil: conserva una identificación de llamada, una identificación de giro cuando esté disponible, marcas de tiempo monótonas, tipo de evento y un pequeño conjunto de campos sin contenido. No existe un buen valor universal para ninguno de los intervalos. El dispositivo ejecutable utilizado para este artículo establece maxFirstResponseMs a 1200 y maxInterruptStopMs a 300 por lo que la regla de decisión es inspeccionable. Esos son ejemplos de valores políticos, no estándares de la industria. Calibre con rutas de red reales, idiomas, estilos de habla, necesidades de accesibilidad y el costo de una falla falsa. Una prueba de liberación también debería preservar la incertidumbre. Si falta user speech stop, no calcule la latencia a partir de una marca de tiempo de transcripción. Si el evento de interrupción existe pero la parada del asistente no, regresa barge in failed o insufficient evidence según el contrato de recogida. Nunca fabriques un intervalo saludable a partir de eventos incompletos. Repita una precedencia de falla antes de probar llamadas en vivo El artefacto complementario contiene ocho flujos de llamadas sin contenido. Cada evento tiene una marca de tiempo relativa y solo los campos necesarios para la clasificación: Ejecútelo con: El encuentro ejecutado produjo la paridad exacta esperada en ocho veredictos: La precedencia es importante. Verifique la accesibilidad antes de cronometrar porque una llamada no respondida no puede tener una primera respuesta significativa. Verifique el tiempo y la interrupción antes de que la herramienta tenga efecto porque es posible que la persona que llama ya haya experimentado una interacción interrumpida. Concilie el efecto de la herramienta antes de evaluar la finalización del terminal porque volver a intentar un efecto secundario incierto puede duplicar el trabajo. Exija que el resultado sea el último porque es el reclamo más fuerte. Este orden es una regla operativa, no una clasificación de gravedad. Una cancelación fallida puede tener más impacto que un audio lento. Dirija la gravedad del flujo de trabajo y las consecuencias para el usuario una vez que se conoce la capa de evidencia. Mantenga el recibo de la herramienta separado del recibo del resultado. Un agente de voz a menudo invoca una herramienta de programación, pago, emisión de boletos o transferencia. El resultado de la herramienta del modelo no es necesariamente el estado duradero del destino. Asigne a cada intento de efectos secundarios una ID de operación estable. Conserve la acción solicitada, la clase de destino, el número de intento, la clase de respuesta y una verificación de efecto sin contenido. Si el transporte se agota después del envío, concilie ese ID de operación antes de volver a intentarlo. Una segunda solicitud con una nueva identidad puede crear una cita duplicada o una cancelación. Luego verifique el resultado prometido por la persona que llama de forma independiente. El efecto de una herramienta puede ser real mientras el resultado del usuario sigue siendo incorrecto: existe una cita con la cuenta incorrecta, una transferencia conectada a un IVR en lugar de un operador, o una cancelación cambió un artículo mientras el paquete solicitado permanece activo. el accesorio false complete El caso es deliberadamente inconveniente. Tiene una llamada conectada, una primera respuesta de 600 ms, una recepción de efecto de herramienta verificada y un estado de llamada completada. Todavía falla porque outcome.verified está ausente. Ese es el caso exacto en el que es probable que se pierda una puerta de solo transcripción. Un evaluador de LLM sigue siendo útil para cualidades que son difíciles de codificar de manera determinista: si el agente reconoció su frustración, explicó claramente una política o siguió un estilo de interacción. Mantenga su veredicto con la capa de evaluación de transcripción. No permita que sobrescriba la accesibilidad, las marcas de tiempo, los recibos de destino o el estado externo. Envíe el recibo más pequeño y seguro para su privacidad El clasificador no necesita audio de la persona que llama ni transcripción de texto. Un recibo mínimo puede contener ID de llamada y giro seudónimos, marcas de tiempo relativas, tipos de eventos, estado del terminal, versión de política hash, ID de operación y efectos booleanos y resultados. Conserve las grabaciones solo cuando el consentimiento, la política de retención y el valor de depuración lo justifiquen. Antes del lanzamiento, ejecute el dispositivo fijo para probar el clasificador en sí. Luego, realice un pequeño conjunto de llamadas reales entre los operadores, regiones, idiomas y comportamientos de las personas que llaman que sean importantes. Revise las distribuciones de umbrales en lugar de limitarse a una sola llamada de laboratorio limpio. Por último, reproduzca los fallos de producción como nuevos casos de regresión sin copiar el contenido confidencial de la conversación en el conjunto de pruebas. La limitación es sencilla: este artefacto valida una regla de decisión, no la calidad del reconocimiento de voz ni el tiempo de actividad de cualquier proveedor. No puede elegir umbrales para las personas que llaman. Sin embargo, sí evita que una conversación refinada se confunda con un trabajo verificado. Sidewisp se encuentra actualmente en versión preliminar privada. Su experiencia pública es un sitio web de acceso temprano y una demostración interactiva; La recopilación y recuperación del estado del agente de producción no se envían en el repositorio del sitio web actual. La dirección del producto es una capa de salud en torno a los tiempos de ejecución existentes, no una plataforma de voz, un proveedor de telefonía o un reparador autónomo. Si este recibo de cinco puertas coincide con las fallas que necesita detectar, puede únete a la vista previa privada de Sidewisp y describa el tiempo de ejecución del agente de voz que opera.