2026-07-31T06:47:45.965Z
Agentforce Testing Center で AI エージェントをテストする: 結果の受領書が必要
個別のサブエージェント、アクション、および応答の評価を、承認と宛先結果の受信を伴うバージョン固定のプロモーション ゲートに変換します。
Agentforce テスト センターで AI エージェントをテストする 必要がある場合は、そのサブエージェント、アクション、および応答の評価を 1 つのリリース判定としてではなく、3 つの個別の証拠として使用します。合理的なデフォルトは、サンドボックスで肯定的なケースと否定的なケースを実行し、予想されるルートとアクションに対して新しいパスを要求し、プロモーションの前にビジネス効果を個別に検証することです。 最後の領収書が重要です。エージェントは、意図したレコード変更が存在しないか、重複しているか、間違ったスコープに適用されているか、承認を待っている間に、予期されるサブエージェントを選択し、予期されるアクションを呼び出し、許容可能な応答を生成できます。緑色のテスト行は、その行が何を評価したかを証明します。目的地の結果が自動的に証明されるわけではありません。 このガイドでは、1 つの Agentforce テストの実行を 8 つの状態の昇格ゲートに変換します。このフィクスチャには、発話、応答、顧客記録、秘密は保存されません。合格/不合格の状態、鮮度、承認の状態、および結果の受信の判定のみが保持されます。 テストセンターの結果は証拠であり、リリースの評決ではありません Salesforceの現状テストセットアップユニット発話、予期されるサブエージェント、予期されるアクション、および予期される応答を含むテスト ケースについて説明します。その結果ユニット次に、実際のサブエージェントとアクションに加えて、個別のサブエージェント、アクション、および応答の評価を公開します。それぞれの障害が異なる修復を示すため、この分離は役に立ちます。 サブエージェントの失敗: ルーティングで間違った責任境界が選択されました。 アクションの失敗: ルートは妥当ですが、必要な操作が欠落しているか、異なります。 応答失敗: ルートと呼び出しは正しい可能性がありますが、応答は予期されたセマンティック結果を満たしていません。 これらのフィールドを 1 つのパーセンテージに折りたたまないでください。エージェントがアドレスが更新されたと言ったため、連絡先更新ケースが応答評価に合格したとします。アクションの評価が失敗した場合、その文は書き込みが行われたという証拠にはなりません。 3 つの評価がすべて合格した場合でも、宛先のリードバックが副作用の強力な証拠となります。 鮮度についても同様の注意が必要です。エージェント バージョン 12、テスト スイート リビジョン 4、および昨日のアクション メタデータの合格実行では、指示または権限の変更後にバージョン 13 を認証できません。すべてのプロモーション決定を少なくとも以下に結び付けます。 領収書には内容が含まれないようにしてください。不透明な識別子、バージョン、タイムスタンプ、ブール値、およびハッシュを保存します。プロンプト、顧客データ、認証情報、または完全なモデル応答をモニタリング レコードにコピーしないでください。 スコアが重要になる前に安全境界線もあります。 Salesforceの現状テストツールと考慮事項のユニットエージェントのテストで CRM データが変更される可能性があることを警告し、オペレーターにサンドボックスでテストするよう指示します。これは脚注ではなく、厳密な前提条件として扱います。専用のフィクスチャ、可逆レコード、最小権限のテスト ID、クリーンアップ検証を使用します。誤って本番環境に影響を与えたテストが成功した場合、それは健全なテストとは言えません。 1 回のテスト実行を 8 つの状態への昇格ゲートに変える この記事に付随する検査可能なアーティファクトは、コンテンツのない 8 つのケースを厳密な順序で評価します。この順序により、下流の緑色のフィールドが以前の障害を隠すことを防ぎます。 州 証拠 オペレーターの判断 RUN INCOMPLETE テストジョブが完了していません 待って;失敗や成功を推測しないでください STALE RESULT 結果は許容された証拠の年齢を超えています 意図したバージョンに対して再実行する SUBAGENT MISMATCH サブエージェントの評価に失敗しました 修復ルーティング、範囲、またはテストの期待 ACTION MISMATCH アクションの評価に失敗しました 権限、指示、アクションプランを検査する RESPONSE MISMATCH 応答の評価に失敗しました 回答基準または応答行動を修正する WAITING 正当な承認が未処理である 所有者に通知します。履歴書のコンテキストを保持する OUTCOME UNVERIFIED テスト センターのフィールドは合格しましたが、目的地証明がありませんでした 昇格前に効果を読み返す HEALTHY 新たなルート、行動、対応、結果の証拠が一致 制限付き昇格決定を許可する Node.js を使用してアーティファクトを実行します。 予想される概要は次のとおりです。 重要な実験は最後のペアのケースです。どちらも完了した新たな実行があり、サブエージェント、アクション、および応答の評価に合格しています。 effect unverified 宛先の領収書がないため、次のように解決されます。 OUTCOME UNVERIFIED ; healthy 検証済みのリードバックを追加し、次のように解決します。 HEALTHY 。 1 つのフィールドによってリリースの判定が変わります。 そのリードバックは、約束された結果と一致するはずです。 CRM 更新の場合は、分離されたテスト ID を使用して目的のレコードをクエリし、予期されるフィールドのみを比較します。 電子メールまたは通知の場合は、サンドボックスの送信ボックスまたはプロバイダーの受信を確認し、受け入れられた効果を 1 つだけアサートします。 知識に関する回答の場合は、散文を一語一語一致させるのではなく、必要な引用や出典の識別子を検証します。 ワークフローハンドオフの場合は、永続的なハンドオフレコード、所有者、期限、および再開トークンを確認します。 権限が必要なリクエストの場合は、次のように記録します。 WAITING ;エージェントが正しく一時停止したからといって、エージェントを停止中とマークしないでください。 これは意図的に普遍的な評価ではありません。分類子は、Agentforce の現在の結果フィールドを独自の安定した受信契約にマッピングしていることを前提としています。事実の品質を判断したり、すべてのユーザーの表現をシミュレートしたり、サンドボックスが運用許可を反映していることを証明したりするものではありません。また、許容可能な合格率のベースラインを決定することもできません。 Salesforce のドキュメントには、生成動作は確率的であり、各組織が独自の運用準備しきい値を定義する必要があると記載されています。 ドリルを実行し、実稼働境界を設定します 結果が確定的に検査できる価値の高いタスクを 1 つ開始します。 1,000 個のプロンプトを生成した状態から始めないでください。信頼できる期待値を持つ小規模なスイートでは、予期されるアクションが 1 回の偶発的な実行からコピーされた大きなスイートよりも多くのことが明らかになります。 1. テスト ID を凍結します。 エージェントのバージョン、スイートのリビジョン、アクション メタデータのリビジョン、権限セットのリビジョン、およびサンドボックス ID を記録します。 2. ポジティブなケースとネガティブなケースを定義します。 Salesforce の設定ガイダンスでは両方を推奨しています。有効なリクエスト、無効なリクエスト、許可されていないリクエスト、権限が不足しているケース、および承認が必要なケースが含まれます。 3. サンドボックスで実行します。 可逆レコードをシードし、クリーンアップを証明します。環境またはアイデンティティがあいまいな場合は中止します。 4. 3 つの評価を個別に検査します。 最も初期に失敗した境界を修復します。応答の書き換えによって、欠落しているアクションが隠蔽されてはなりません。 5. 結果を読み戻します。 冪等キーまたは安定したテスト レコードを含む宛先固有のアサーションを使用します。 6. 健全なケースを繰り返します。 1 回のパスでは、確率的な不安定性が明らかになりません。確実性を宣言するのではなく、実行数と信頼区間を表示しておきます。 7. 固定されたアーティファクトのみをプロモートします。 指示、アクション、権限、モデル構成、またはテストの期待値が変更された場合は、古いレシートを期限切れにします。 8. 実際の結果を個別に監視します。 実稼働前評価によりリスクが軽減されます。到達可能性、スケジュール、待機状態、許可、コスト、または起動後の成果物の健全性を置き換えるものではありません。 最後の境界は、エージェントのテストとエージェントの健全性が分岐する場所です。テストでは、変更がプロモートされる前に、選択したシナリオが許容できる動作をするかどうかが尋ねられます。運用の健全性では、実行中のエージェントが到達可能な状態を維持しているか、有用な進捗が得られているか、ツールに到達しているか、承認の境界を尊重しているか、期待どおりの結果が現在生成されているかどうかが問われます。両方必要ですが、一方がもう一方の代わりになることはできません。 Sidewisp は、運用上の健全性レイヤー (証拠の鮮度、有用な進捗状況、ツールへのアクセス、待機中か行き詰まり、検証済みの結果) を中心に設計されています。 Sidewisp は現在プライベートプレビュー段階です。 公開サイトとインタラクティブなデモンストレーションはライブです。本番環境の Agentforce アダプタ、ライブ モニタリング エンジン、および自動リカバリ エグゼキュータは出荷されません。現在の実際的な手順は、内容のないレシートを Agentforce テスト実行の横に保管し、目的の結果がまだ不明な場合は昇格を拒否することです。