2026-08-01T14:17:57.263Z
Метрики оценки агента AI: пять сигналов, без совокупного балла
Используйте пять ясных знаменателей и твердые доказательства, чтобы сравнить выпуска агентов, не скрывая ложного успеха, неизвестных эффектов инструмента или дорогостоящих неудач.
Методы оценки агента AI должны отвечать на вопрос о выпуске, а не украшать панель управления. Для агента, использующего инструменты, компактным дефолтом являются пять измерений, которые держатся отдельно: качество задачи, полезный прогресс, целостность эффекта инструмента, стоимость на проверенный результат и процент ложных успехов. Зарегистрируйте информацию о доказательствах рядом с каждым. Затем сделайте отсутствующие результаты и неизвестные эффекты инструмента твердыми воротами, прежде чем оптимизировать средние. Это порядок имеет значение. Кандидат может написать лучшую прозу, закончить быстрее, и выглядеть дешевле на пробежку, создавая непроверенный результат. Процензирование этих сигналов на один балл превращает небезопасный выпуск в числовое улучшение. Сделайте пять знаменателей вместо одного балла . Оценка агента имеет более одного объекта интереса. Инженерный справочник по оценке агентов Anthropic отличает задачи, повторяющиеся испытания, оценки, транскрипты и окончательное состояние окружающей среды. Пример бронирования полетов полезная граница: транскрипт может указывать, что рейс был бронирован, а результат наличие бронирования в базе данных. Нынешний Описание агентской оценки Vertex AI делает еще одно разделение. Оценка окончательного ответа спрашивает, достиг ли агент цели; траектории проверяют путь, включая точные или упорядоченные совпадения действий, точность, отзыв и использование одного инструмента. Обе точки зрения полезны, но ни одна из них не должна молча отстаивать другую. Используйте этот пятиметровый контракт: Метрические показатели Числитель Именователь Сохранить отдельно Роль освобождения Качество задач Сумма версионных рубрик или детерминистических оценок качества Испытания, на которые на самом деле прошел качественный оценщик Сравнительная версия, охват, несогласие Оптимизировать после прохождения твердых доказательств Полезный прогресс Активные окна наблюдения с дельтой доказательств для конкретной задачи Наблюдаемые активные окна Явные окна ожидания и устаревшие коллекторы Поверхность, затем оптимизируйте Целостность эффекта инструмента Внешние эффекты, проверенные в пункте назначения Проверенные + неудачные + неизвестные попытки воздействия Умышленно отклонившиеся звонки, неизвестные последствия Твердый пол Стоимость на проверенный результат Общая покрытая стоимость эксплуатации Результаты, проверенные по месту назначения Оцененная стоимость, отсутствие покрытия расчетов Бюджетный уровень и оптимизация Уровень ложных успехов Объявленные завершения, результаты которых не были проведены Все заявленные завершения Завершения, удостоверение которых не было доступно Тяжелое вето Каждый знаменатель предотвращает другую ложь. Среднестатистическое качество без охвата класса вознаграждает самые простые примеры. Успех инструмента без доказательств назначения путает успешный звонок с успешным эффектом. Стоимость за пробег вознаграждает дешевые неудачи. Уровень завершения награждает агента за оценку собственного требования. Операционная телеметрия по прежнему принадлежит к регистру. Закрепленный OpenTelemetry Сноска данных по генАИ определяет инструменты статуса разработки для использования токенов, длительности работы, длительности агента, количества выводов, количества инструментов и длительности инструментов. Эти измерения объясняют рабочую нагрузку и эффективность. Они не утверждают, что существует файл, что один раз был создан счет или что запланированный отчет достиг назначения. Запишите запись доказательств перед выбором порогов Начнем с одного ряда на каждое испытание. Не начинайте с совокупной таблицы. Для минимальной записи требуется достаточно информации, чтобы воспроизвести каждый числитель, знаменатель, исключение и недоступное состояние: Важное значение не 0.90 , а разногласия вокруг него. Ответный оценщик любил выход, но проверщик результатов не был доступен, и эффект инструмента оставался неизвестным. Это испытание может научить вас качеству реакции. Она не может поддержать заявление о освобождении. Используйте три показания, если отсутствие возможно: verified означает, что названный предикат пробежал против предполагаемого места назначения и прошел. failed означает, что предикат прошел и ожидаемое состояние отсутствовало или было неприемлемо. unavailable означает, что никакого приговора не было возможно, потому что проверяющий, собиратель, разрешение или доказательства о назначении отсутствовали. Не преобразуйте unavailable в нуль или успех. Ноль это измерение; недоступность дефект покрытия. Подобное забота требуется и для ожидания. Пробег с явным владельцем одобрения, запрошенным решением, сроком действия и состоянием перезагрузки не застрял. Считать полезный прогресс во время активных окон до ожидания, а затем остановить часы активного прогресса. Сохраняйте отказ в вызове инструмента с высоким воздействием в качестве доказательства того, что граница сработала; не считайте намеренное отказ в отказе инструмента неудачей. Качество задач это один показатель, который, вероятно, потребует нескольких типов оценщиков. Используйте детерминистические тесты для структурированных полей, файлов, рядов базы данных, статуса HTTP и точных условий политики. Модель оценщик может оценить тон, релевантность или открытый артефакт, но хранить его запрос, модель, версию рубрики и образец калибровки. Человеческий обзор остается необходимым, когда решение является последовательным или уровень несогласия модели оценки не понимается. Воспроизводить обратное освобождение Артефакт, сохраненный в этой статье, содержит десять синтетических испытаний: пять для stable v1 и пять для fast v2 . Используйте Node.js 20 или более: Объявленные пороги: Точное резюме: Вариант Качество Полезный прогресс Проведены эффекты инструмента Стоимость / расход Стоимость / проверенный результат Ложный успех Непроверенный полный Ворота : : : : : : : stable v1 0.818 (4/4) 14/14 5/5 $0.41 $0.52 0/4 0 ПАСС fast v2 0.902 (5/5) 15/16 4/5 $0.38 $0.63 1/5 1 Неудача Три замечания меняют решение. Во первых, fast v2 выглядит дешевле, когда знаменатель работает: 0,38 доллара вместо 0,41 доллара. Как только расходы делятся на проверенные результаты, вывод отворачивается: 0,63 доллара вместо 0,52 доллара. Быстрая версия тратит меньше на каждую попытку и больше на каждый результат, которому можно доверять. Во вторых, более высокий балл качества 0,902 не исправляет отсутствующий результат. Один из полированных комплектующих не смог проверить окружающую среду, а другой не имел использоваемого верификатора. Средние показатели качества и полезного прогресса остаются диагностическими, но они не являются полномочиями для публикации, оплаты, сообщения, удаления или иным образом принятия внешнего воздействия. В третьих, stable v1 содержит законное ожидание одобрения. Он отсутствует в номинаторе качества завершенного испытания, но прогресс, достигнутый до ожидания, и намеренный отказ в использовании инструмента остаются видимыми. Метрический контракт не вознаграждает театральное завершение и не наказывает правильную паузу. Этот эксперимент является противопоказанием, а не эталоном. Цены, испытания и пороги создаются для проверки бухгалтерского правила. Они не оценивают процент ложных успехов производства, и $0.60 не является универсальным бюджетом. Доказательства шлюзов перед оптимизацией качества Применять показатели в фиксированном порядке: 1. Check coverage. Каждое заявленное завершение требует вердикта о результатах или явного недоступного состояния. Каждая попытка создания эффективных инструментов требует проверенных, неудачных или неизвестных доказательств назначения. 2. Block False Success. Если заявленное завершение не удалось проверить результаты, прекратите выпуск. Исследуйте предсказание завершения, а не стиль ответа. 3. Block неизвестные эффекты. Неизвестный побочный эффект это граница инцидента. Спросите местонахождение или согласовывайте ключ "идемпотенция" перед повторной попытками. 4. Проверьте прогресс и полы инструментов. Сравните сходные задачи и сохраняйте действительные ожидания. Регрессия прогресса или провальный показатель эффекта инструмента могут оправдать отступление даже при повышении конечного качества. 5. OОптимизируйте качество и стоимость. Только сейчас сравнивайте рубрики, задержка, токены и стоимость на проверенный результат. Это преднамеренно не взвешенный композит. Весы призывают к переговорам между не связанными вредами: достаточноя плавность может математически отменить один двойной платеж; достаточное количество дешевых пробегов может скрыть отсутствующий отчет. Политика все еще может использовать весы внутри рубрики качества задач, но охват доказательств и внешние эффекты остаются вне этого показателя. Выберите пороги из последствий рабочего процесса и базовой линии. Исследовательский агент только для чтения может терпеть более низкий уровень эффекта инструмента, потому что большинство звонков обратимы. Публикация, расчет, сообщение клиентов или агент контроля доступа должны требовать квитанции по месту назначения, безразличие и нулевую цель ложного успеха для охваченного тестового комплекта. Сообщите интервалы доверия, когда количество испытаний достаточно большое, и покажите сырое количество, когда это не так. Пять испытаний это 0/5 , а не доказательство нулевого показателя неудачи населения. Сохранять оценку и здоровье производства взаимосвязанными, но различными. Онлайн испытания показывают, выживает ли кандидат из известных сценариев. Мониторинг производства говорит вам, остаются ли реальные расписания, учетные данные, зависимости, затраты и результаты здоровыми после выпуска. Проходный пакет это разрешение на развертывание в объеме объявленного, а не доказательство того, что будущие запуски не могут потерпеть неудачу. Направление продукта Sidewisp состоит в том, чтобы поставить результаты, прогресс, инструмент, доступность, память и доказательства затрат в один взгляд на состояние здоровья вокруг существующих сроков действия агента. Это не замена времени запуска, обязательный шлюз или автономный фиксатор. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Общественная библиотека сайта и статей в режиме реального времени; коллекция продуктового агента здоровья, адаптеры запуска, анализ стоимости токенов и выполнение восстановления, как правило, не отправляются. Сначала используйте пятиметрический контракт на один последовательный рабочий процесс. Если версия с наиболее привлекательным средним пока не достигла результата или эффекта инструмента, то показатели выполняют свою работу.