2026-07-31T06:47:39.699Z
Testare un agente AI nel Centro test Agentforce: Richiedi ricevute dei risultati
Trasforma le valutazioni separate di subagente, azione e risposta in un portale di promozione bloccato in base alla versione con ricevute di approvazione e di risultato di destinazione.
Se devi testare un agente AI in Agentforce Testing Center , utilizza le valutazioni del suo subagente, dell'azione e della risposta come tre elementi di prova separati, non come un unico verdetto di rilascio. L'impostazione predefinita ragionevole è: eseguire casi positivi e negativi in una sandbox, richiedere nuovi passaggi per il percorso e le azioni previsti, quindi verificare l'effetto aziendale in modo indipendente prima della promozione. L'ultima ricevuta è importante. Un agente può scegliere l'agente secondario previsto, richiamare l'azione prevista e produrre una risposta accettabile mentre la modifica del record prevista è assente, duplicata, applicata all'ambito sbagliato o ancora in attesa di approvazione. Una riga di test verde dimostra ciò che valuta quella riga. Non dimostra automaticamente il risultato della destinazione. Questa guida trasforma un test di Agentforce in un portale di promozione in otto stati. Il dispositivo non memorizza espressioni, risposte, record dei clienti o segreti; mantiene solo gli stati superato/fallito, la freschezza, lo stato di approvazione e un verdetto di esito ricezione. Il risultato del Testing Center è una prova, non il verdetto di rilascio L'attuale Salesforceunità di configurazione del testdescrive i casi di test con un'espressione, un subagente previsto, azioni previste e una risposta prevista. Suounità di risultatiquindi espone il subagente e le azioni effettivi oltre a valutazioni separate di subagente, azione e risposta. Questa separazione è utile perché ogni guasto indica una riparazione diversa: Errore del subagente: il routing ha selezionato il limite di responsabilità errato. Azione fallita: il percorso era plausibile, ma l'operazione richiesta mancava o era diversa. Errore di risposta: il percorso e le chiamate potrebbero essere corretti, ma la risposta non ha soddisfatto il risultato semantico previsto. Non comprimere questi campi in un'unica percentuale. Supponiamo che un caso di aggiornamento del contatto superi la valutazione della risposta perché l'agente afferma che l'indirizzo è stato aggiornato. Se la valutazione dell'azione fallisce, la frase non costituisce la prova che la scrittura sia avvenuta. Anche quando tutte e tre le valutazioni vengono superate, una rilettura della destinazione è ancora la prova più forte di un effetto collaterale. La stessa cautela vale per la freschezza. Un'esecuzione di passaggio per la versione 12 dell'agente, revisione 4 della suite di test e i metadati dell'azione di ieri non possono certificare la versione 13 dopo un'istruzione o una modifica di autorizzazione. Vincolare ogni decisione di promozione almeno a: Conservare la ricevuta priva di contenuto. Memorizza identificatori opachi, versioni, timestamp, booleani e hash. Non copiare richieste, dati del cliente, credenziali o risposte complete del modello in un record di monitoraggio. C'è anche un limite di sicurezza prima che qualsiasi punteggio abbia importanza. L'attuale Salesforceunità di strumenti e considerazioni di testavverte che i test degli agenti possono modificare i dati CRM e indica agli operatori di eseguire i test in una sandbox. Consideratelo come una precondizione difficile, non come una nota a piè di pagina. Utilizza dispositivi dedicati, record reversibili, identità di test con privilegi minimi e verifica della pulizia. Un test riuscito che ha toccato per errore la produzione non è un test salutare. Trasforma una corsa di prova in un cancello di promozione in otto stati L'elemento ispezionabile che accompagna questo articolo valuta otto casi privi di contenuto in un ordine rigoroso. Tale ordine impedisce a un campo verde a valle di nascondere un errore precedente: Stato Prova Decisione dell'operatore RUN INCOMPLETE Il lavoro di prova non è stato completato Aspettare; non dedurre il fallimento o il successo STALE RESULT Il risultato supera l'età della prova accettata Eseguire di nuovo contro le versioni previste SUBAGENT MISMATCH Valutazione del subagente non riuscita Riparare il routing, l'ambito o le aspettative del test ACTION MISMATCH La valutazione dell'azione non è riuscita Ispeziona autorizzazioni, istruzioni e piano d'azione RESPONSE MISMATCH La valutazione della risposta non è riuscita Riparare i criteri di risposta o il comportamento di risposta WAITING Resta in sospeso un'approvazione legittima Avvisare il proprietario; preservare il contesto del curriculum OUTCOME UNVERIFIED I campi del Testing Center sono superati, la prova di destinazione è assente Rileggi l'effetto prima della promozione HEALTHY Il nuovo percorso, l’azione, la risposta e le prove dei risultati concordano Consentire la decisione di promozione limitata Esegui l'artefatto con Node.js: Il riepilogo previsto è: L'esperimento importante è l'ultimo paio di casi. Entrambi hanno una nuova esecuzione completata e superano le valutazioni dell'agente secondario, dell'azione e della risposta. effect unverified non ha ricevuta di destinazione e si risolve a OUTCOME UNVERIFIED ; healthy aggiunge una rilettura verificata e si risolve in HEALTHY . Un campo modifica il verdetto di rilascio. Tale rilettura dovrebbe corrispondere al risultato promesso: Per un aggiornamento CRM, interroga il record desiderato con un'identità di test isolata e confronta solo i campi previsti. Per un'e mail o una notifica, verifica la casella di posta in uscita della sandbox o la ricevuta del fornitore e dichiara esattamente un effetto accettato. Per una risposta basata sulla conoscenza, convalida le citazioni richieste o gli identificatori delle fonti anziché abbinare la prosa parola per parola. Per un trasferimento del flusso di lavoro, verificare il record di trasferimento durevole, il proprietario, la scadenza e il token di ripresa. Per una richiesta che richiede autorizzazione, record WAITING ; non contrassegnare l'agente bloccato solo perché è stato messo in pausa correttamente. Questo non è intenzionalmente un valutatore universale. Il classificatore presuppone che tu abbia mappato i campi dei risultati correnti di Agentforce nel tuo contratto di ricevuta stabile. Non giudica la qualità fattuale, non simula le frasi di ogni utente o dimostra che una sandbox rispecchia i permessi di produzione. Inoltre, non può decidere la linea di base accettabile per il tasso di superamento. La documentazione di Salesforce rileva che il comportamento generativo è probabilistico e che ciascuna organizzazione deve definire la propria soglia di preparazione alla produzione. Esegui il trapano, quindi imposta il limite di produzione Inizia con un'attività di alto valore il cui risultato è controllabile in modo deterministico. Non iniziare con mille prompt generati. Una suite più piccola con aspettative affidabili rivelerà più di una suite di grandi dimensioni le cui azioni previste sono state copiate da un'esecuzione incidentale. 1. Blocca l'identità del test. Registra la versione dell'agente, la revisione della suite, la revisione dei metadati dell'azione, la revisione del set di autorizzazioni e l'identificatore sandbox. 2. Definire casi positivi e negativi. La guida alla configurazione di Salesforce consiglia entrambi. Includere una richiesta valida, una richiesta non valida, una richiesta non consentita, un caso con autorizzazione mancante e un caso con richiesta di approvazione. 3. Esegui in una sandbox. Semina record reversibili e dimostra la pulizia. Interrompere se l'ambiente o l'identità sono ambigui. 4. Esaminare le tre valutazioni separatamente. Riparare il primo limite non riuscito. Una riscrittura della risposta non deve nascondere un'azione mancante. 5. Rileggi il risultato. Utilizza un'asserzione specifica della destinazione con una chiave di idempotenza o un record di test stabile. 6. Ripetere i casi sani. Un singolo passaggio non espone instabilità probabilistica. Mantieni visibili il conteggio delle analisi e l'intervallo di confidenza anziché dichiararne la certezza. 7. Promuovi solo l'elemento bloccato. Se cambiano istruzioni, azioni, autorizzazioni, configurazione del modello o aspettative del test, fa scadere la vecchia ricevuta. 8. Monitora separatamente il risultato dal vivo. La valutazione pre produzione riduce i rischi; non sostituisce la raggiungibilità, la pianificazione, lo stato di attesa, l'autorizzazione, il costo o l'integrità dei risultati finali dopo il lancio. Questo confine finale è il punto in cui i test degli agenti e la loro salute divergono. Il test chiede se gli scenari selezionati si comportano in modo accettabile prima che venga promossa una modifica. L'integrità operativa chiede se l'agente in esecuzione rimane raggiungibile, fa progressi utili, raggiunge i suoi strumenti, rispetta i limiti di approvazione e produce ora il risultato atteso. Hai bisogno di entrambi, ma uno non può sostituire l'altro. Sidewisp è progettato attorno a quel livello di integrità operativa: freschezza delle prove, progressi utili, accesso agli strumenti, attesa o blocco e risultati verificati. Sidewisp è attualmente in anteprima privata. Il sito pubblico e la dimostrazione interattiva sono in diretta; non vengono forniti un adattatore Agentforce di produzione, un motore di monitoraggio in tempo reale e un esecutore di ripristino automatizzato. Il passo pratico oggi è conservare la ricevuta senza contenuto accanto alla prova di Agentforce e rifiutare la promozione quando l'esito della destinazione è ancora sconosciuto.