2026-08-01T15:00:29.434Z

Фреймворк тестирования агента AI: выбирайте по доказательствам, а не по количеству характеристик

Устройство с четырьмя воротами сравнивает повторяющую игру, эффект инструмента, память и доказательства результатов, а затем выявляет адаптеры для каждой рекомендации.

Фреймворк для испытаний агентов AIZ должен быть выбран по доказательствам, которые он может воспроизвести и проверить, а не по количеству показателей в каталоге. Для состоятельного агента, использующего инструменты, разумным первым прототипом является проверка AI, когда центральными являются одноразовые среды, исполнение внешнего агента и кодовые коды. Сценарий LangWatch это лучше сформированный прототип, когда доминируют имитируемые пользователи и поведение в нескольких поворотах. MLflow подходит для команд, чьи наборы данных об оценке и история экспериментов уже являются организационным слоем; DeepEval подходит для регрессионного рабочего потока, ориентированного на pytest. Это прототип порядка, а не универсальная таблица лидеров. Ни одна из этих систем не знает, был ли ваш счет создан один раз, сохранилась ли ваша память после перезапуска или действителен ли ваш обещанный платеж. Это оракулы для применения. Процесс отбора является честным только тогда, когда он называет оставшуюся работу до усыновления. Начнем с доказательств, которые должна оставить рамка Тесты агентов не расширенные оперативные тесты. Агент меняет состояние в течение нескольких поворотов, пересекает границы разрешений, призывает инструменты, ждет, пытается снова, и может закончить с внешним артефактом. Ответ на этот вопрос является одним из нескольких наблюдений. Руководство по оценке агентов Anthropic разделяет задачу, испытания, транскрипт, результат, арсенал оценки и оценщики. Он также отличает классификацию на основе кода, модели и человека. Это разложение дает нам полезный вопрос отбора: Откуда будет происходить каждый решающий факт? Используйте четыре ворота: Ворота Необходимые доказательства Общие ложные заменители Повторять То же устройство может восстанавливать соответствующие входы, состояние инструмента, разрешения и стартовые данные Повторное отправление одного и того же запроса Эффект инструмента Направление доказывает, что намеченный эффект произошел с правильной идентичностью и количеством Следы говорят, что инструмент был назван Продолжительность памяти Необходимые решения выдерживают границу, которую вы действительно боитесь: перезагрузка, сжатие или передача Разговор имеет несколько сторон. Проверка результатов Детерминистическая проверка доказывает, что обещанный артефакт или состояние существует и является действительным Агент говорит, что всё закончено. Рамочка может раскрыть крюки для всех четырех без применения ваших четырех доказательств. Это приемлемо. Плохой результат заключается в том, чтобы скрыть запрос на базе данных, установку перезагрузки или подтвердитель артефакта под неясным ярлыком интеграция. Различие имеет самое главное в двух границах. Призыв к инструменту может быть прекращен после того, как место назначения совершит его изменение, поэтому успех транспорта и успех эффекта могут быть несовместимыми. Многоразовый тест может сохранить состояние в одном процессе, в то время как развернутый агент теряет одно и то же решение после перезагрузки. Если сравнение с рамками не соответствует любой из паров, его оценка не является полезной для надежности агента. Четыре текущие рамки, прочитанные через эти ворота Я просмотрел текущую официальную документацию 27 июля 2026 года и зафиксировал только документированные поверхности. Уровень "обычностей" ниже не является критикой; это означает, что рамки обеспечивают точку расширения, в то время как приложение должно предоставлять правду. Iinspect AI документирует составляемые наборы данных, агенты, инструменты и счетчики, выполнение внешним агентом, журналы оценки и несколько sandbox backends. Его официальный обзор даже использует агента, действующего через инструменты внутри песчаного ящика Docker. Это делает его мощной стартовой поверхностью для выполняемых, состоятельных задач. Настройка может осмотреть окружающую среду. Ему все еще нужен подключатель к реальному месту назначения и преднамеренно построенный оракул памяти для перезапуска. LangWatch Scenario начинается с многоразовой симуляции, а не с статического ряда ввода вывода. Его документация по моделированию агента показывает промежуточные ожидания при звонке инструмента, пользовательские утверждения, такие как созданный билет, тесты восстановления ошибок и воспроизведение проблем, обнаруженных в производстве. Эта форма привлекательна для поддержки, голоса и других интерактивных агентов. Документированное состояние беседы не является доказательством того, что решение пережило смерть процесса, и заявление о билете все еще является кодом заявления. MLflow организует оценку вокруг наборов данных, функций прогнозирования, баллов, результатов выполнения, обратной связи человека и мониторинга. текущий обзор оценки GenAI делает пользовательские оценки первоклассной частью оценки. Это полезно, когда команда уже рассматривает наборы данных и экспериментную линией как источник истины. Стоимость отбора это состояние, связанное с функцией прогнозирования: восстановление мира инструментов, принуждение к перезапуску и согласование внешних эффектов. DeepEval предлагает локальные тестовые курсы, одно и многотурные случаи, пороговые значения, отслеживание и регрессионное сравнение в рабочем процессе с формой pytest. Его быстрый старт это простой путь для команд, которые хотят оценивать, помимо тестов приложения. Quickstart опирается на модели, основанные на метрике, поэтому оперативное доказательство соответствия должно добавлять детерминистические эффекты и результаты проверки, а не предполагать, что оценка судьи доказывает состояние назначения. Рассмотрение Документированный центр тяжести Прототип сначала, когда Явные адаптеры для испытаний Проверка AI Исполняемые задачи агента, инструменты, песчаные ящики, забиватели Агент изменяет файлы или другое проверяемое состояние Реальный эффект назначения; перезагрузка памяти Сценарий LangWatch Симуляция в нескольких шагах и утверждения по шагам Поведение пользователей и пути восстановления приводят к неисправности Реальный эффект назначения; перезагрузка памяти MLflow Набор данных, счетчики, история прохождения, обратная связь Цикл жизни оценки и родословная уже существуют в MLflow Установка состояния; эффект; память перезагрузки Глубокий эваль Питест стильный метрический регресс и отслеживание Команда нуждается в легкой входной точке для испытаний. Состояние фиксации; эффект; память перезагрузки; детерминистический результат Эта таблица намеренно более узкая, чем сравнение продуктов. В нем ничего не говорится о цене хостинга, поддержке, отзыве менеджеров или каждой интеграции. Он отвечает на один вопрос: какая документально подтвержденная поверхность исполнения ближе всего к доказательствам, необходимым для этого агента? Запустите селектор, а потом не доверяйте результатам. В сопровождающем framework evidence.json зафиксированы четыре уровня доказательств для каждого кандидата. 0 означает отсутствие сохранившихся доказательств из первичного источника, 1 означает, что требуется конкретный адаптер или счетчик, а 2 означает, что документация представляет собой первоклассный рабочий процесс. Сценарий состояния инструмента измеряет вес воспроизведения на 2 , эффекты инструмента на 4 , непрерывность памяти на 4 и проверенные результаты на 5 . Запустить артефакт: Решающая часть выпуска составляет: Инспекция и сценарий LangWatch получают взвешенный показатель доказательств 22 . Инспекция выигрывает эту фиксацию только потому, что заявленная рабочая нагрузка stateful tool , что добавляет трехзначный бонус. Измените рабочую нагрузку на многоразовую симуляцию, и порядок должен измениться. Измените весы, и результат может измениться. Эта чувствительность является особенностью: она делает предположения команды пересматриваемыми. Счёт никогда не должен устранять пробелы. Результат, который утверждает, что работа адаптера здесь будет менее достоверной, не больше. Матрица не может знать схему назначения, правило идентичности для эффекта, решения, которые память должна сохранить, или правило валидности для доставки. У артефакта также есть одно трудное ограничение: это проверка документации с датой. Он не устанавливает все четыре рама или не измеряет время интеграции. Используйте его, чтобы выбрать порядок экспериментов, а затем дайте два неудобных случая решать. Доказательство соответствия провалится двумя различными способами Первый случай проверяет неоднозначный эффект инструмента. Установите фиксированный пункт назначения, в котором инструмент совершает один объект, а затем перевозка возвращает перерыв времени. Сборник проходит только в том случае, если он может: 1. сохранять стабильную операционную идентичность через границу повторного испытания; 2. проверять место назначения, а не доверять результату вызова; 3. классифицировать государство как обязательное, а не слепо пытаться вновь; 4. показывать доказательства в записке, которую разработчик может дебгурировать. Во втором случае тесты перезагружают непрерывность. Позволь агенту выбрать ограниченный план, настаивать только на разрешенном состоянии решения, прекратить его процесс, и возобновить новый процесс. Сборник проходит только в том случае, если он может: 1. доказать, что произошла перезагрузка; 2. восстанавливать то же устройство без утечки состояния скрытого ответа; 3. проверять, что требуемое решение сохранилось; 4. обнаруживает устаревшую, отсутствующую или противоречивую память; 5. проверять окончательный артефакт самостоятельно. Если агент просит разрешения, включайте законную ожидание в качестве контроля. Испытательный ремень, который отмечает каждую паузу как неисправность, будет оказывать давление на продукт, чтобы удалить безопасные границы полномочий. Доказательства должны отличать работу, ожидание, застряв и завершение, а не вознаграждать непрерывную деятельность. Прототип в часовой ящик. Небольшая команда не должна создавать общий слой адаптера, пока она не воспроизведет эти две неисправности. Дайте каждому кандидату одинаковую фиксацию, одинаковый исходный оракул и одинаковый бюджет дебюгирования. Предпочтительно использовать систему, которая делает цепочку доказательств самой короткой и самой проверяемой, даже если другой кандидат производит более совокупные показатели. Результат не framework X лучше. Это framework X достигает наших двух твердых доказательств с этими названиями адаптеров, и рамка Y не в пределах одного бюджета. Это заявление может выжить пересмотр кода. Испытания не свидетельствуют о здоровье живых агентов. Предварительная оценка выпуска отвечает на вопрос, может ли конструкция справиться с известными задачами и контролируемыми неисправностями. Live health спрашивает, доступен ли конкретный развернутый агент сейчас, делая полезный прогресс, сохраняя необходимый контекст, достигая своих инструментов, производя ожидаемый результат и оставаясь в разумных пределах времени и затрат. Прохождение оценки не доказывает, что планщик был уволен вчера вечером, аккредитив действителен сегодня, или доставка достигла своего истинного назначения. Целевая территория Sidewisp это слой здоровья вокруг существующих сроков работы: отличить работу от ожидания или задержки, показать доказательства и свежесть, и проверить результаты до устранения проблемы. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Общественный опыт это веб сайт с ранним доступом и интерактивная демонстрация; коллекция продуктового агента здравоохранения, адаптеры запуска и автоматическое восстановление обычно не отправляются. Так что держи границы ясными. Используйте выбранную испытательную систему, чтобы контролируемые регрессии были видны до выпуска. Используйте конкретные данные о времени выполнения и независимые проверки результатов, чтобы установить состояние здоровья живых после выпуска. Зелёный тест это ценное доказательство, но это не разрешение рассматривать незамеченный развернутый агент как здоровый.