2026-08-01T11:10:49.979Z
К науке о AI агенте Надежность: проверка доказательств
Превратите двенадцать показателей в проверяемый профиль доказательств, а затем добавьте живые медицинские квитанции, необходимые для принятия решения о развертывании.
Краткое оперативное чтение Towards a Science of AI Agent Reliability заключается в следующем: сохранить четырехмерный профиль бумаги, но никогда не принимать ряд из двенадцати баллов без доказательств, которые произвели их. Для решения о развертывании также добавьте текущее доказательство доступности, ожидаемых запусков, собственных ожиданий, эффектов инструмента и результатов назначения. Профиль ссылки и ответ на вердикт о здоровье, связанный с другими вопросами. Июнь 2026 arXiv v3 paper Стефана Рабансера и его коллег измеряют надежность независимо от точности выполнения задач. Он оценивает 15 моделей на GAIA и очищенном подмножестве τ банка, а затем расщепляет надежность на последовательность, надежность, предсказуемость и безопасность. Результат авторов намеренно неудобен: увеличение возможностей за изученное окно выпуска не производило автоматически сопоставимых повышений надежности. Это полезно для оператора, но только после перевода каждого показателя в договор доказательства. Ниже приведенный контрольный список выполняет этот перевод и четко указывает на остальные границы производства. Прочитайте двенадцать показателей в качестве запросов на доказательства В таблице 2 статьи содержатся двенадцать показателей. Это не двенадцать взаимозаменяемых точек качества. Размер Учетные показатели на бумаге Минимальные доказательства Совместимость результат; распределение траекторий; последовательность траекторий; использование ресурсов Версия задач, независимое количество запусков, Oracle результатов, последовательности действий, ресурсные единицы и каждый запись на каждый запуск Устойчивость неисправность; окружающая среда; немедленность Испытания базовых показателей, пары с нарушениями, версия спецификации нарушения и доказательство того, что окружающая среда или быстрое изменение сохранили значение задачи Предсказуемость калибровка; дискриминация/AUROC; Brier Уверенность, полученная до классификации, доказательства двойных результатов, метод бининга или ранжирования, количество образцов и источник доверия Безопасность соответствие требованиям; степень тяжести вреда Версионные ограничения, каждое нарушение, правила строгости, идентичность и версия судьи, а также образец человеческой проверки Поэтому первое оперативное правило просто: метрика a без ее знаменателя, протокола и местоположения доказательств недоступна, не низкая и не здоровая . Рассмотрим последовательность результатов. Повторное выполнение сорока задач пять раз дает 200 испытаний, но результат сам по себе не говорит вам, перемены одних и тех же задач между успехом и неудачей или неудачей фиксированного подмножества каждый раз. Эти модели могут иметь аналогичную среднюю точность и очень разные эксплуатационные последствия. В документе существует метрика, чтобы выявить это различие; отказ от доказательств на уровне испытаний воссоздаст проблему, которую он решает. Установки прочности требуют еще большего ухода. Показатель отказных инъекций интерпретируется только относительно базовой линии. Показатель быстрого прочности действителен только в том случае, если варианты остаются семантически эквивалентными. Переименование поля JSON может проверить хрупкость окружающей среды; удаление информации, необходимой для решения задачи, изменяет задачу. Сохраняйте генератор тревоги, его версию и пересмотренную выборку рядом с результатом. Предсказуемость требует аналогичного строгого времени. Убедись, что ты уверен, прежде чем получишь результат. Уверенность, написанная после того, как агент увидел результат теста, не является прогнозом. Также запишите, пришла ли стоимость от агента, отдельной модели, калиброванного классификатора или эвристики. Калибрационные, AUROC и Brier баллы могут быть исчислены правильно из неправильного сигнала доверия. Наконец, сохраните границы безопасности бумаги. Его общественная методология сообщает о безопасности отдельно от совокупного показателя надежности. Это правильный дефолт для операций. Сильный показатель последовательности не должен отражать одно несанкционированное разрушительное действие. Установки соблюдения, как часто соблюдались ограничения; тяжести условного ущерба задается вопросом, насколько серьезными были нарушения. Вам нужна как частота, так и хвост. Профилирование до обсуждения порогов Аргументы по порогу являются преждевременными, когда пакет доказательств является неполным. Я построил небольшой профильный линтер , который сначала проверяет структуру: существуют все двенадцать названных показателей; каждая метрика имеет счет, нумератор, знаменатель, протокол и URI доказательств; результаты надежности включают в себя пары исходных показателей и количества нарушений плюс версионная спецификация; результаты предсказуемости определяют источник доверия; результаты безопасности определяют ограничения и метод оценки; безопасность не включена в общий агрегат надежности; автономное развертывание включает в себя непустую проверенную человеком образцу безопасности. Затем он проверяет шесть классов свидетельств о живом состоянии здоровья: свежесть, доступность, охват расписания, ожидаемость, расписки на эффекты инструмента и расписки по результатам назначения. В включенном иллюстративном профиле представлены все двенадцать показателей на бумаге и обзор безопасности человека в 30 случаях. Результат остается следующим: У двух блокировщиков отсутствуют полученные расписки по эффекту инструмента и результатам назначения. Затем тест линтера предоставляет эти две сведения о доказательствах и изменяет результат на PASS . Это не доказывает, что вымышленный агент безопасен, это доказывает, что доказательства достаточно полны, чтобы пересмотреть. Различие имеет значение. Провести аудит с помощью: Это преднамеренно скромный артефакт. Она подтверждает присутствие и форму, а не научную достоверность. Она не может решить, представляет ли эталон ваших пользователей, является ли отчет о доверии честным, означают ли два запроса одно и то же или правильно оценил ли судья LLM ущерб. Эти задачи остаются задачами доменного обзора. Не превращайте профиль в один номер выпуска В статье рассчитываются агрегаты измерений для сравнения, но собственные выборы показывают, почему операторы должны держать профиль видимым. В целом агрегат надежности сочетает в себе последовательность, предсказуемость и надежность; безопасность остается отдельной. В статье также указаны важные ограничения: два эталона охватывают только узкий участок задачи, используется один эскафард на эталон, оценка безопасности зависит от судьи LLM, выбор метрики и агрегации субъективный, а температура нуля может переоценить надежность, доступную в условиях, выбранных для максимальной точности. Эти пределы должны быть указаны рядом с решением о развертывании, а не в архивированной методической записке. При практическом обзоре можно использовать три слоя: 1. Полность профиля: Разве двенадцать показателей подтверждаются проверяемыми доказательствами? 2. ПРОСТАНИЕ: Какие размеры и условия хвоста приемлемы для данной задачи и уровня полномочий? 3. OОперационные доказательства: Может ли текущая развернутая система достичь, продвигаться, ограничиваться и получать намеченный внешний результат? Второй слой обязательно специфичен для применения. Помощник по составлению проекта с обязательным человеческим обзором может терпеть различные несоответствия от безконтрольного агента по возмещению. В статье говорится о том же общем: требования к надежности должны масштабироваться с автономией. Избегайте копирования рейтингового рейтинга в универсальный порог выпуска. Для последствий побочных эффектов используйте вето перед средними показателями. Одна разумная местная политика заключается в следующем: Такое упорядочение удерживает привлекательные средние от скрытия неизвестных или тяжелых состояний. Добавьте доказательства производства, о которых в бумаге не утверждается, что они измеряются Сравнительный показатель оценивает поведение в соответствии с определенным протоколом. Оператор также должен знать, что происходит сейчас. Добавьте эти шесть квитанций , не притворяясь , что это дополнительные бумажные показатели: Свежесть свидетельств E: при последней проверке каждого медицинского сигнала и его истечении. Доступность: , можно ли сейчас связаться с рабочим временем и необходимыми инструментами. Покрытие расписания: , в которых ожидаемые курсы начались, завершились, пересекались или пропустили. Ожидание собственности: , имеет ли законная зависимость владельца, срок действия и состояние переоборудования. Эффект приспособления: независимо от того, изменилось ли действие, которое было отсрочено или перепробовано, в нулевое, одно или несколько раз. Проверка результата назначения: , существует ли обещанный файл, изменение базы данных, сообщение, результат испытаний или другой результат доставки и удовлетворяет правилу принятия. Данное дополнение предотвращает ошибки двух категорий. Во первых, неоднократный успех эталонного показателя не доказывает, что в настоящее время можно достичь срока производства. Во вторых, успешный командный или модельный ответ не доказывает, что внешний эффект или доходность существует. ХАЛ репозиторий для арнеев, связанный с сайтом проекта, полезен здесь, потому что он подчеркивает воспроизводимые оценки, следы, изоляцию и отслеживание затрат. Это сильные результаты оценки. Они все еще нуждаются в конкретном отчете о результатах развертывания и текущих оперативных расписках, когда агент действует вне эталонов. Используйте бумагу в качестве профиля, а не разрешения Для реального обзора, начинайте с одного потока работы, а не целого флота: 1. Запишите время выполнения, модель, обязательство на эскафолде, версии инструментов, версию задач и дату оценки. 2. Используйте повторные номинальные испытания и сохраняйте результаты, траектории и записи ресурсов. 3. Определите ошибку, окружающую среду и немедленные нарушения, прежде чем осмотреть результат. 4. Убедись в себе до оценки. 5. Определить ограничения и уровни тяжести; человеко одобрить безопасную выборку. 6. Сохраняйте безопасность отдельно от агрегата. 7. Присоедините к ним шесть классов доказательств живого здоровья. 8. Зарегистрируйте unknown там, где отсутствуют доказательства. 9. Установление порогов и вето для полномочий и последствий этого процесса работы. 10. Повторяйте профиль после изменения модели материала, запроса, экрана, инструмента или среды. Это сохраняет главный вклад бумаги: надежность это форма, а не синоним точности. Это также мешает этой форме стать декоративной панелью управления. Обсуждаемый результат обзора не считан рейтинг надежности. Это версия решения с проверяемыми доказательствами, ясными неизвестными и четким списком того, что необходимо проверить, прежде чем расширяется власть. Запланированная территория Sidewisp является оперативной стороной этой границы: доступность, полезный прогресс, контекст, инструменты, результаты и стоимость вокруг агентов, которые уже работают в других местах. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Его адаптеры мониторинга производства и системы восстановления обычно не поставляются, поэтому в этой статье описывается метод работы, а не текущая автоматизированная возможность Sidewisp. Если эта граница доказательств совпадает с ошибками, которые вы должны обнаружить, вы можете присоединиться к частному просмотру с сайта Sidewisp. Источники Rabanser и др., К науке о надежности агентов AI, arXiv v3, июнь 2026 Методология надежности Leaderboard о целостном агенте Репродуктивное арсенал оценки HAL Страница плаката ICML 2026 Запись OpenReview