2026-07-31T18:48:10.301Z

AI 语音代理测试:证明通话真正完成了任务

一套五项验证,覆盖通话连接、轮次时序、插话中断、工具副作用以及对来电者结果的独立核验。

AI语音代理测试不应仅仅因为文字记录听起来合理就通过了授权。一个有理据的测试能证明五个不同的事实:通话已连接,座席在工作流特定的限制内响应,中断实际上停止了助理音频,每个副作用工具都达到了已知结果,以及来电者请求的结果存在于对话之外。 这种区分很重要,因为常见的产物回答的问题更狭窄。录音证明了音频的存在。一份文字记录证明语音识别能产生文本。LLM评分标准用于估算该文本是否符合某项标准。终端电话状态证明通话已结束。仅凭这些事实并不能证明预约已被预订、取消或转接已到达目的地。 实际的默认做法是保留模拟器和转录评估器,然后在它们旁边添加一个小型确定性通话回执。 流畅的转录文本只是一层证据 语音模拟很有用。Vapi目前的语音测试文档描述了目标代理与测试代理之间的真实电话通话,随后进行录音、转录,并对LLM进行评分标准的评估。这比纯文本提示测试更能锻炼路径。 它仍然会留下可观察的空隙。文字稿可以省略来电结束与音频播放开始之间的确切界限。在来电者打断助理时,它可以干净地读取。即使远程系统超时,它也可能包含工具的可靠确认。 电话完成的含义同样狭义。Twilio文件包括 queued 、 ringing 、 in progress 、 completed 、 busy 、 failed 、 no answer 和 canceled 通话状态。呼叫资源引用还警告 completed 表示连接已建立,音频传输。可能是有人、IVR或语音信箱接听。因此,“完成”是运输证据,而非商业判断。 改用五项关卡: 门 证据最少 这是失败,它暴露了 可达性 关联通话ID加上已连接或 in progress 状态 排队,无人接听,目的地无效 轮次时序 用户音频停止在 t1 ;助理音频从 t2 开始 反应缓慢,被连贯的记录掩盖 中断 用户中断 t3 ;助理音频停靠 t4 代理继续打断来电者 工具效应 稳定操作ID加上目的地收据 暂停后进行不安全的盲重试 结果 对承诺结果的独立核查 正常通话结束,没有预订、转接或取消 一开始不要把这些合并成一个分数。加权平均可以让优秀的转录文本掩盖一个缺失的结果。保持失败的层可见。 记录音频边界,而不只是模型延迟 有用的首次响应间隔从来电音频被认为完成时开始,到助理音频实际开始播放时结束: 这与模型的“到首次令牌时间”不同。语音终端、转录、模型推断、合成、缓冲和电话传输都存在于来电者的体验中。只测量一个内部阶段可以让响应缓慢的通话看起来健康。 中断需要另一个配对观察: Vapi 的 服务器事件文档 分别显示状态更新、语音更新、发言更新、电话 user interrupted 、工具调用和通话结束事件。报告指出,中断可以与言语停止证据结合使用。其他提供商使用不同名称,但合同可移植:保留呼叫ID、可用时的轮次 ID、单调时间戳、事件类型以及一小部分非内容字段。 这两个区间都没有普遍的良好值。本文所用的可执行夹具将 maxFirstResponseMs 设为1200, maxInterruptStopMs 设为300,因此判定规则可检验。这些只是政策价值的示例,而非行业标准。根据真实的网络路径、语言、说话方式、无障碍需求以及错误故障的代价进行校准。 发布测试还应保持不确定性。如果缺少用户语音停止,请不要从文字记录时间戳中计算延迟。如果中断事件存在但助理停止事件没有,则根据采集契约返回 barge in failed 或 insufficient evidence 。永远不要在不完整的事件中制造一个健康的间隔。 在测试真实通话前重放故障优先级 伴随的工件包含八个无内容的调用流。每个事件都有相对时间戳,仅包含分类所需的字段: 运行方式如下: 执行的比赛在八项判决中实现了完全相同的预期结果: 优先权很重要。在确定时间前,先检查可接通性,因为无人接听的电话无法有实质性的首次响应。在工具效果前检查时间和中断,因为来电者可能已经经历过断裂的互动。在评估终端完备之前,先协调工具效应,因为重试不确定的副作用可能会重复工作。最后要求结果,因为它是最有力的主张。 该命令是操作规则,而非严重程度排名。取消失败的影响可能比慢音频更大。在证据层已知后,将严重性和用户后果从工作流程中路由。 将工具副作用回执与结果回执分开 语音代理通常调用调度、付款、工单或转账工具。模型的工具结果不一定是目的地的持久状态。 为每次副作用尝试设定稳定操作ID。保留请求的操作、目的类、尝试次数、响应类和无内容效果检查。如果提交后传输超时,请在重试前对照该操作ID。第二次申请新身份可能会重复预约或取消。 然后独立验证来电者承诺的结果。工具效应可能真实存在,但用户结果仍然错误:预约存在错误账户、转账连接到IVR而非运营商,或取消更改了一项商品而请求的捆绑包仍然有效。 该固定器的 false complete 箱体故意制造不便。它包含已连接的通话、600毫秒的首次响应、已验证的工具效果接收以及已完成的通话状态。但还是失败了,因为 outcome.verified 缺席。这正是仅靠转录文本的门槛最容易错过的情况。 LLM评估器对于难以确定性编码的特性仍然有用:代理是否承认了挫折、清晰解释了策略,或遵循了某种交互风格。保持其评价与转录文本评估层的关系。不要让它覆盖可达性、时间戳、目的收据或外部状态。 保存最小化且保护隐私的回执 分类器不需要来电者的音频或文字记录。最小收据可以包含假名呼叫和回合ID、相对时间戳、事件类型、终端状态、哈希策略版本、操作ID,以及布尔效应和结果。只有在同意、保留政策和调试价值证明值得时,才保留录音。 发布前,运行固定夹具以验证分类器本身。然后在重要的载波、地区、语言和来电者行为之间运行一小组真实通话。要审视阈值分布,而不是只看一次干净的实验室呼叫。最后,将生产失败作为新的回归案例回放,同时不将敏感对话内容复制到测试套件中。 局限性很简单:这个产物验证的是决策规则,而不是语音识别质量或任何服务商的正常运行时间。它无法为来电者选择阈值。不过,这确实防止了一场精心打磨的对话被误认为是经过验证的作品。 Sidewisp 目前处于私密预览阶段。 其公众体验是一个早期访问网站和互动演示;生产代理健康状态的收集和恢复未在当前网站仓库中发布。产品方向是围绕现有运行时构建的健康层,而非语音平台、电话服务提供商或自主中介。 如果这个五项收据与你需要发现的失败相符,你可以用语言代理加入Sidewisp私密预览并描述你操作的语音代理运行时间。