2026-08-01T02:45:13.090Z
Протестируйте агента ИИ в центре тестирования Agentforce: потребуйте квитанции о результатах
Превратите отдельные оценки субагентов, действий и ответов в шлюз продвижения с привязкой к версии с квитанциями об одобрении и результатах назначения.
Если вам нужно протестировать ИИ агент в Центре тестирования Agentforce , используйте оценки его субагента, действий и ответов как три отдельных доказательства, а не как один вердикт по выпуску. Разумным решением по умолчанию является следующее: запускайте положительные и отрицательные случаи в «песочнице», требуйте новых проходов для ожидаемого маршрута и действий, а затем независимо проверяйте бизнес эффект перед продвижением. Последняя квитанция имеет значение. Агент может выбрать ожидаемый субагент, вызвать ожидаемое действие и выдать приемлемый ответ, в то время как предполагаемое изменение записи отсутствует, дублируется, применяется к неправильной области или все еще ожидает утверждения. Зеленая тестовая строка подтверждает то, что оценивается в этой строке. Это не доказывает автоматически конечный результат. Это руководство превращает один тестовый запуск Agentforce в продвижение по службе с восемью состояниями. Устройство не хранит никаких высказываний, ответов, записей клиентов или секретов; он сохраняет только состояния «пройдено/не пройдено», актуальность, состояние утверждения и вердикт о получении результата. Результат Центра тестирования является доказательством, а не вердиктом о выпуске Текущая версия Salesforceблок настройки тестированияописывает тестовые примеры с высказыванием, ожидаемым субагентом, ожидаемыми действиями и ожидаемым ответом. Егоблок результатовзатем предоставляет фактический субагент и действия, а также отдельные оценки субагента, действия и ответа. Такое разделение полезно, поскольку каждый сбой указывает на отдельный ремонт: Сбой субагента: в маршрутизации выбрана неверная граница ответственности. Неудачное действие: маршрут был правдоподобен, но требуемая операция отсутствовала или отличалась. Сбой ответа: маршрут и вызовы могут быть правильными, но ответ не соответствует ожидаемому семантическому результату. Не сводите эти поля к одному проценту. Предположим, что случай обновления контакта проходит оценку ответа, поскольку агент сообщает, что адрес был обновлен. Если оценка действия не удалась, предложение не является свидетельством того, что запись произошла. Даже если все три оценки пройдены, обратное считывание адресата по прежнему является более убедительным доказательством побочного эффекта. То же предостережение касается и свежести. Проходной запуск для агента версии 12, версии набора тестов 4 и метаданных вчерашних действий не может сертифицировать версию 13 после изменения инструкций или разрешений. Свяжите каждое решение о продвижении по крайней мере с: Храните квитанцию без содержания. Храните непрозрачные идентификаторы, версии, метки времени, логические значения и хэши. Не копируйте запросы, данные клиентов, учетные данные или полные ответы модели в запись мониторинга. Существует также граница безопасности, прежде чем какой либо счет будет иметь значение. Текущая версия Salesforceблок инструментов и рекомендаций тестированияпредупреждает, что тесты агентов могут изменить данные CRM, и советует операторам проводить тестирование в «песочнице». Относитесь к этому как к жесткому предварительному условию, а не как к сноске. Используйте специальные приспособления, обратимые записи, тестовые идентификаторы с наименьшими привилегиями и проверку очистки. Успешный тест, который по ошибке затронул производство, не является здоровым тестом. Превратите один тестовый прогон в ворота для продвижения по службе в восьми штатах Проверяемый артефакт, прилагаемый к этой статье, оценивает восемь случаев без содержания в строгом порядке. Этот порядок не позволяет следующему зеленому полю скрыть более раннюю неисправность: Состояние Доказательство Решение оператора RUN INCOMPLETE Тестовое задание не завершено Ждать; не делайте вывод о неудаче или успехе STALE RESULT Результат превышает допустимый возраст доказательств Повторный запуск для предполагаемых версий SUBAGENT MISMATCH Оценка субагента не удалась Восстановить маршрутизацию, объем или ожидания теста ACTION MISMATCH Оценка действия не удалась Проверьте разрешения, инструкции и план действий. RESPONSE MISMATCH Оценка ответа не удалась Исправить критерии ответа или поведение ответа WAITING Законное одобрение является выдающимся Уведомить владельца; сохранить контекст резюме OUTCOME UNVERIFIED Поля Центра тестирования пройдены, подтверждение пункта назначения отсутствует Прочтите эффект перед продвижением HEALTHY Свежие данные о маршруте, действиях, ответных мерах и исходах совпадают. Разрешить решение об ограниченном повышении Запустите артефакт с помощью Node.js: Ожидаемое резюме: Важным экспериментом является последняя пара случаев. Оба имеют завершенный новый запуск и проходят оценки субагента, действия и ответа. effect unverified не имеет квитанции о назначении и решает OUTCOME UNVERIFIED ; healthy добавляет проверенное обратное чтение и разрешает HEALTHY . Одно поле меняет вердикт о выпуске. Это повторное чтение должно соответствовать обещанному результату: Для обновления CRM запросите предполагаемую запись с изолированным тестовым идентификатором и сравните только ожидаемые поля. Для электронного письма или уведомления проверьте почтовый ящик песочницы или квитанцию поставщика и подтвердите ровно один принятый эффект. Чтобы получить ответ, подтверждающий знания, подтвердите необходимые цитаты или идентификаторы источников, а не сопоставляйте прозу слово в слово. Для передачи рабочего процесса проверьте запись постоянной передачи, владельца, крайний срок и токен возобновления. Для запроса, требующего полномочий, запишите WAITING ; не отмечайте, что агент застрял только потому, что он правильно приостановил работу. Это намеренно не универсальный оценщик. Классификатор предполагает, что вы сопоставили текущие поля результатов Agentforce с вашим собственным контрактом о стабильном получении. Он не оценивает фактическое качество, не имитирует каждую фразу пользователя и не доказывает, что песочница отражает производственные разрешения. Он также не может определить ваш приемлемый базовый уровень проходимости. В документации Salesforce отмечается, что генеративное поведение является вероятностным и что каждая организация должна определить свой собственный порог производственной готовности. Запустите учение, а затем установите границы производства Начните с одной важной задачи, результат которой поддается детерминированному контролю. Не начинайте с тысячи сгенерированных подсказок. Меньший пакет с заслуживающими доверия ожиданиями покажет больше, чем большой пакет, ожидаемые действия которого были скопированы из одного случайного запуска. 1. Заморозить идентификационную информацию теста. Запишите версию агента, версию пакета, версию метаданных действий, версию набора разрешений и идентификатор песочницы. 2. Определите положительные и отрицательные случаи. В руководстве по настройке Salesforce рекомендуются оба варианта. Включите действительный запрос, недопустимый запрос, запрещенный запрос, случай отсутствия разрешения и случай, требующий утверждения. 3. Выполнение в песочнице. Заполнение обратимых записей и проверка очистки. Прервать выполнение, если среда или личность неоднозначны. 4. Проверьте три оценки по отдельности. Отремонтируйте самую раннюю неисправную границу. Переписывание ответа не должно скрывать пропущенное действие. 5. Прочитайте результат. Используйте утверждение, специфичное для пункта назначения, с ключом идемпотентности или стабильной тестовой записью. 6. Повторите здоровые случаи. Один проход не выявляет вероятностную нестабильность. Держите количество прогонов и доверительный интервал на виду, а не декларируйте уверенность. 7. Продвигайте только закрепленный артефакт. Если инструкции, действия, разрешения, конфигурация модели или ожидания от тестирования изменяются, срок действия старой квитанции истекает. 8. Отдельно отслеживайте результаты в реальном времени. Предварительная оценка снижает риск; он не заменяет доступность, расписание, состояние ожидания, разрешение, стоимость или работоспособность доставки после запуска. Эта последняя граница — это то место, где тестирование агентов и работоспособность агентов расходятся. При тестировании выясняется, приемлемо ли ведут себя выбранные сценарии, прежде чем будет предложено внести изменение. Оперативное состояние проверяет, остается ли работающий агент доступным, достигает ли он полезных результатов, достигает ли своих инструментов, соблюдает ли границы одобрения и дает ли ожидаемый результат сейчас. Вам нужны оба, но одно не может заменить другое. Sidewisp разработан с учетом этого уровня эксплуатационного состояния: актуальность данных, полезный прогресс, доступ к инструментам, ожидание или зависание и проверенные результаты. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Публичный сайт и интерактивная демонстрация доступны в режиме реального времени; производственный адаптер Agentforce, механизм оперативного мониторинга и средство автоматического восстановления не поставляются. Практический шаг сегодня — хранить квитанцию без содержимого рядом с тестовым запуском Agentforce и отказываться от повышения, если результат назначения еще неизвестен.