2026-07-31T18:48:15.613Z

AI音声エージェントのテスト:通話が目的を果たしたことを証明する

接続、ターンのタイミング、割り込み、ツールの副作用、発信者が求めた結果を確認する5段階のテスト。

AI音声エージェントのテストは、トランスクリプトがもっともらしく聞こえるからといってリリースを通過すべきではありません。正当なテストは5つの異なることを証明します:通話が接続されたこと、エージェントがワークフロー固有の制限内で応答したこと、中断で実際にアシスタントの音声が停止したこと、各副作用ツールが既知の結果に達したこと、そして発信者の要求された結果が会話の外に存在していることです。 この区別は重要です。なぜなら、通常のアーティファクトはより狭い問いに答えるからです。録音が音声の存在を証明しています。書き起こしは音声認識がテキストを生成したことを証明しています。LLMルーブリックは、そのテキストが基準を満たしているかどうかを推定します。端末の電話状態が通話終了の証明となります。これらの事実だけでは、予約が入ったこと、キャンセルが行われたこと、転送が目的地に到達したことを示すものではありません。 実用的なデフォルトは、シミュレーターとトランスクリプト評価器を残し、その隣に小さな決定論的な通話レシーバーを追加することです。 流暢なトランスクリプトは一層の証拠にすぎない ボイスシミュレーションは役立ちます。Vapiの現在のボイステストのドキュメントは、ターゲットエージェントとテストエージェント間の実際の電話通話を記述し、その後、記録、書き起こし、ルーブリックに照らしたLLM評価を実施するものです。それはテキストのみのプロンプトテストよりもはるかに多くの道筋を行使します。 それでも観察可能な空白は残ります。トランスクリプトでは、発信者が音声を終えてから音声再生が始まるまでの正確な境界を省略することができます。発信者がアシスタントの話をかき消した後は、きれいに読み取れます。リモートシステムがタイムアウトしても、ツールの確信的な確認が含まれている場合があります。 電話完成も同様に狭い意味を持ちます。Twilioは queued 、 ringing 、 in progress 、 completed 、 busy 、 failed 、 no answer 、 canceled 通話状態を文書化しています。また、コールリソース参照は接続が確立され音声が転送されたことを意味する completed 警告もしています。本人、IVR、留守番電話などが応答したかもしれません。したがって「完了」は輸送の証拠であり、ビジネスの判断ではありません。 代わりに5つのゲートを使いましょう: 門 最低限の証拠 それは失敗を露呈させる 到達のしやすさ コールIDと接続済みまたは in progress 状態の相関 キュー待ち、応答なし、目的地が無効 ターンタイミング ユーザーの音声は t1 で停止しました。アシスタントオーディオは t2 一貫した書き起こしに隠された遅い反応 中断 t3 でのユーザー中断;アシスタントの音声が立ち寄った t4 エージェントは通話相手の話を続けている ツール効果 安定操作IDと宛先領 タイムアウトの後、危険なブラインドリトライ 結果 約束された結果の独立確認 通常の通話は予約、転送、キャンセルなしで終了します 最初はこれらを一つのスコアにまとめないでください。加重平均は、優れたトランスクリプトが結果の欠落を隠してしまうことがあります。失敗したレイヤーは見えるように保ちましょう。 モデルのレイテンシだけでなく音声境界を記録する 有用なファーストレスポンス間隔は、発信者の音声が完全に終わった時点で始まり、アシスタント音声が実際に再生され始めた時点で終了します。 これはモデルの「最初のトークンまでの時間」とは同じではありません。音声エンドポイント、文字起こし、モデル推論、合成、バッファリング、電話転送はすべて発信者の体験の中に位置しています。内部段階を1段階だけ測定することで、応答の遅い通話も健康的に見せることができます。 中断にはもう一つのペアの観察が必要です: Vapiのサーバーイベントドキュメントは、ステータス更新、音声更新、 user interrupted 、ツールコール、通話終了イベントを別々に公開します。中断は発話停止の証拠と組み合わせることができると指摘しています。他のプロバイダーは異なる名称を使っていますが、契約は移植可能です。コールIDを保持し、利用可能な場合はターンID、単調なタイムスタンプ、イベントタイプ、そして非コンテンツフィールドの少数セットを保持します。 どちらの区間にも普遍的な良さはありません。この記事で使用された実行可能なフィクスチャは、 maxFirstResponseMs を1200、 maxInterruptStopMs を300に設定しているため、判定ルールは検査可能です。それらは業界標準ではなく、政策の例として表れています。実際のネットワーク経路、言語、話し方、アクセシビリティのニーズ、そして誤った失敗のコストに合わせて調整してください。 リリーステストは不確実性も保持すべきです。ユーザースピーチストップが欠けている場合は、トランスクリプトのタイムスタンプからレイテンシを計算しないでください。中断イベントが存在するがアシスタントストップが存在しない場合は、収集契約に従って barge in failed または insufficient evidence を戻します。不完全な出来事から健全な間隔を作り出してはいけません。 実際の通話を試す前に失敗の優先順位を再生する 伴随アーティファクトには8つのコンテンツのない呼び出しストリームが含まれています。各イベントには相対的なタイムスタンプがあり、分類に必要なフィールドのみが存在します: 以下で実行してください: 執行された試合は8つの判定で正確な予想通りの均衡を生み出しました。 優先順位は重要です。未応答の電話は意味のある第一応答を得られないため、タイミングを決める前に連絡可能性を確認してください。ツール効果の前にタイミングと中断を確認しましょう。発信者はすでに不適切なインタラクションを経験している可能性があります。終端完了を評価する前にツール効果を調整してください。不確かな副作用を再試すると作業が重複する可能性があるからです。結果を最後に求めましょう。なぜならそれが最も強力な主張だからです。 この命令は運用規則であり、重症度のランキングではありません。キャンセル失敗は遅い音声よりも影響が大きいことがあります。エビデンスレイヤーが分かった後にワークフローから深刻さとユーザーの結果をルーティングします。 ツール効果のレシートと結果のレシートを分ける ボイスエージェントはしばしばスケジューリング、支払い、チケット作成、または転送ツールを呼び出します。モデルのツール結果は必ずしも目的地の耐久性状態とは限りません。 すべてのサイドエフェクトの試みに安定した操作IDを付与します。要求されたアクション、デスティネーションクラス、試み回数、レスポンスクラス、そして内容のない効果チェックを保持します。提出後にトランスポートがタイムアウトした場合は、再試行前にそのオペレーションIDを照合してください。新しい身分での2回目のリクエストは、重複予約やキャンセルを作成することがあります。 そして、発信者の約束された結果を独立して検証します。ツール効果は、ユーザーの結果が間違っている間に現実に存在することもあります。例えば、間違ったアカウントで予約が存在したり、オペレーターではなくIVRに紐づいた転送があったり、キャンセルが一つの項目が変更されたのにリクエストされたバンドルがアクティブなままの場合です。 このフィクスチャの false complete ケースは意図的に不便に作られています。接続された通話、600msの初回応答、ツール効果の確認済み受信、完了した通話状況が確認されています。それでも失敗するのは、 outcome.verified が欠如しているからです。これは、トランスクリプトのみのゲートが見逃しやすいまさにそのケースです。 LLM評価者は、決定論的に符号化が難しい特性、すなわちエージェントがフラストレーションを認めたか、ポリシーを明確に説明したか、あるいはやり取りスタイルを踏んだかなどに役立ちます。トランスクリプト評価層でその判断を保持してください。到達可能性、タイムスタンプ、宛先の受領書、外部状態を上書きさせないでください。 プライバシーに配慮した最小限のレシートを保存する 分類器は発信者の音声や文字起こしテキストを必要としません。最小限のレシートには、仮名のコールおよびターンID、相対的なタイムスタンプ、イベントタイプ、ターミナル状態、ハッシュ化されたポリシーバージョン、オペレーションID、ブール効果および結果が含まれます。録音は、同意、保持方針、デバッグ価値が正当化される場合にのみ保管してください。 リリース前に、固定されたフィクスチャを実行して分類器自体を証明してください。次に、キャリア、地域、言語、重要な発信者の動作を横断して、実際の通話を少数に実行します。一つのクリーンな検査結果に合わせるのではなく、閾値分布を見直しましょう。最後に、センシティブな会話内容をテストスイートにコピーせずに、新しい回帰ケースとして生産失敗を再生します。 制限は単純で、このアーティファクトは音声認識の品質やプロバイダーの稼働時間ではなく、意思決定ルールを検証するものです。発信者のために閾値を選ぶことはできません。ただし、洗練された会話が検証済みの作品と間違われるのを防ぐことは防いでいます。 Sidewisp は現在プライベートプレビュー段階です。 その公開体験は、早期アクセス可能なウェブサイトとインタラクティブなデモンストレーションです。本当のエージェントの健康情報収集および復旧は、現在のウェブサイトリポジトリには出荷されていません。製品の方向性は、既存のランタイムを囲むヘルスレイヤーであり、音声プラットフォームや電話プロバイダー、自律的なフィクサーではありません。 この5ゲートのレシートが検出すべき失敗と一致すれば、Sidewispのプライベートプレビューに参加しようして運用するボイスエージェントのランタイムを記述できます。