2026-08-02T00:38:23.171Z

Наблюдаемость агента AI: измерение полезного прогресса, а не просто деятельности

Нейтральная пятисигнальная система для информирования производительных агентов о работе из законных ожиданий, стоянки, недосягаемых сроков и ложных результатов успеха.

Наблюдаемость агента AI это способность объяснять, что сделал агент из внешних доказательств: следы, журналы, метрики, события инструмента, модели звонков, задержка, токены и стоимость. Такие доказательства необходимы, но это не медицинский приговор. Отслеживание может быть завершено, пока запрашиваемый файл отсутствует. Призыв к инструменту может быть успешным, пока агент повторяет тот же шаг. Тихое бегство может правильно ждать одобрения. Практический ответ заключается в сохранении телеметрии и добавлении над ней небольшого слоя решения. Для каждой задачи, наблюдать пять вещей вместе: доступность, полезно прогресс дельта, заявленные зависимости, детерминистические проверки результатов, и стоимость в одном окне. Оцените их в таком порядке, прежде чем предупредить или восстановить что либо. Этот справочник превращает это правило в исполняемую фиксацию из пяти случаев. Он намеренно неутрален по времени запуска: это же рассуждение может быть выше расстояний OpenTelemetry, событий Claude Code, журнала запуска OpenClaw или пользовательского агента. Следы доказывают, что ушло, а не что изменилось. Нынешний Семантические конвенции OpenTelemetry для диапазонов агентов GenAI определяет операции для создания и призыва агентов, призывающих рабочие процессы, планирования и выполнения инструментов. Документ обозначен как Development , что имеет значение, когда вы проектируете долгосрочную схему: используйте конвенции там, где они подходят, но изолируйте атрибуты, чувствительные к версии, за вашим собственным уровнем нормализации. Телеметрия запуска уже становится детальной. Мониторинговая документация Клод Код описывает метрики, события и бета распределенные следы. Его следовое дерево может включать взаимодействие, запросы модели, звонки инструмента, блокированное время на решении пользователя и исполнение инструмента. Документированные поля включают в себя длительность, токены, предполагаемые затраты, размер инструмента результата и success . Эти поля отвечают на ценные вопросы: Отреагировала ли она? Какая модель и инструменты работали? Отправил ли конкретный орган инструмента ошибку? Сколько времени потребовалось, чтобы получить разрешение и быть казненным? Сколько токенов и долларов съело бегство? Они не определяют успех вашей задачи. Командование shell, возвращающее код выхода 0 доказывает, что командование выполнено по собственному контракту. Это не доказывает, что статья является публичной, карта сайта содержит ее URL, запрос на снятие проходит CI, или клиентская запись достигла предполагаемой системы. Приложения могут добавить эти проверки, но общее поле успеха инструмента не может их изобрести. Поэтому деятельность и прогресс могут двигаться в противоположных направлениях. Девятнадцать успешных звонков инструмента без выходной дельты могут быть петлей. Два инструментальных вызова, за которыми следует молчание, могут быть здоровым ожиданием рецензента. Последнее сообщение, в котором говорится: "Сделано", может быть ложным успехом, если обещанный артефакт отсутствует. Создайте одно окно здоровья из пяти сигналов Выберите окно наблюдения, специфическое для задачи, прежде чем посмотреть на результат. Пять минут могут подойти для небольшого редактирования кода; час может быть разумным для запланированной исследовательской работы. Избегайте глобального порога, который помечает каждую длительную операцию как застрявшую. В этом окне собирайте пять сигналов: Сигнал Минимальные доказательства Что это мешает Доступность возраст сердечных сокращений, реакция на процесс/сессию или расписатель рассматривать недостижимое время запуска как неудачу в рассуждениях Полезный прогресс монотонная дельта, специфическая для задачи путать повторяющуюся активность с движением Зависимость Причина ожидания, владелец и срок перепробовать работу, которая законно нуждается в человеке или внешней системе Результат детерминистический предикат для обещанного результата принимать сообщение о завершении без доставки Стоимость токены, звонки, время или деньги в одном окне игнорируя дорогостоящие повторные попытки, которые не создают прогресса Полезный прогресс должен быть конкретным. Для кодирующего агента это может быть измененный результат испытания, новый обязательство или снижение количества неудачных испытанийне линии, выпущенные в терминал. Для издательского агентства это может быть идентификатор проекта CMS, затем публичный API, затем живый URL на карте сайта. Для агента поддержки это может быть проверенный переход на билет, а не другой модель ответа. Предпочитаю детерминистический результат, когда он существует: Используйте оценщик только тогда, когда результат не может быть проверен механически, и храните его рубрику, версию и неопределенность. Не собирайте скрытую цепочку мыслей в качестве кратковременного пути. Выбор инструментов, конкретные планы, выходы, временные знаки и изменения состояния обеспечивают оперативные доказательства, не требуя частного рассуждения. Стоимость принадлежит к окну, но стоимость сама по себе не является здоровьем. Можно ожидать 10 долларов, которые приводят к проверенной миграции. Пятьдесят центов, потраченных на повторение неизменного поиска, могут быть аномалией. Полезной выведенной мерой является: max избегает деления нулем; он не делает нулевой прогресс здоровым. Отдельно предупреждать, когда progress delta == 0 и стоимость продолжают расти. Классифицировать работу, ожидание, застряв, недостижимый и ложный успех Решение имеет значение. Сначала проверьте доступность. Затем уважайте явную зависимость, которая все еще находится в своем назначенном времени. Проверьте заявленное завершение с прогнозом результатов, прежде чем принять его. Только тогда можно будет интерпретировать прогресс и прошедшее время. Вот полное устройство NDJSON. Сохраните его как health window fixture.ndjson : Запустить этот классификатор с помощью Node.js: Ожидаемый объем производства: Устройство делает тезис фальсифицируемым. Наивное правило, такое как tool calls 0 , обозначает как run stuck , так и run false success как активные. Правило, основанное только на молчании, признает run waiting нездоровым. Правило из пяти сигналов разделяет их, потому что сохраняет зависимость и доказательства результатов. Примером является скелет решения, а не универсальная модель оценки. Продукционный код также нуждается в свежести, уверенности, идентичности источника и пути uncertain , когда сигналы не согласны. Карта каждого состояния на ограниченный ответ Классификация существует для предотвращения неправильного действия, а не для украшения приборной панели. Государство Необходимые доказательства Ответ по умолчанию Работа недавняя доступность и положительный прогресс дельта оставьте его в покое; пробуйте снова позже Ждём Типовая зависимость, владелец и невыполненный срок сообщать ответственному лицу один раз; не пытайтесь снова сделать заблокированный шаг Застрял. Достижимый, за его окном, без зависимости, без прогресса дельта проверять повторяющийся шаг; подготовить одну обратную повторную попытку или толчок в пределах пределов Ложный успех завершение заявлено, детерминистический результат не удалось возобновить задачу и сообщить отсутствующий предикат; не называть его завершенным Недостижимый устаревшие сердечные сокращения или неудачный контакт проверять доступность хоста/реализации до изменения запросов Неопределенность отсутствующие или противоречивые доказательства собирать отсутствующий сигнал или просить; не автоматизировать восстановление Это разделение имеет полезный прецедент за пределами систем AI. Kubernetes отличает зонды стартапа, жизнеспособности и готовности потому, что процесс существует и услуга должна получать трафик являются разными решениями. В его документации также предупреждается, что плохо разработанные зонды жизнеспособности могут вызвать каскадные сбои при ненужных перезагрузках. Аналогия имеет границу: агент AI не является Под, и полезный прогресс зависит от задачи. Передаваемый урок более узкий, не позволяйте одному неоднозначному зеленому или красному сигналу разрешать каждое вмешательство. Для активного восстановления к действию прилагаются ограничения: одно повторное испытание, а не неограниченное повторное испытание; максимальный просроченный срок и стоимость; обратимый шаг; ясная граница одобрения для разрушительных или внешних действий; проверка прогресса или результата после действия. Завершение команды это не восстановление. Устранить инцидент только после ожидаемого изменения состояния. Используйте контракт, а не каждую мысль. Комплексная нормализованная медицинская запись может находиться рядом с вашими существующими данными о следах: Сохраняйте ссылки на доказательства с контролируемым доступом и редактируйте секреты, запросы, полезные нагрузки на сырые инструменты и абсолютные локальные пути, если они не требуются строго. В медицинской документации должно быть указано, что было проверено и где его могут осмотреть уполномоченные операторы; она не должна становиться второй копией чувствительной телеметрии. Версия четыре вещи явно: 1. адаптер времени запуска, который нормализовал доказательства; 2. определение прогресса; 3. результативный предикат; 4. правила классификатора и пороги. Без этих версий, измененное тестовое командование или переименованное поставляемое может выглядеть как внезапная регрессия агента. Знать, где остановится метод Тяжелая часть не собирать еще один поток. Он честно определяет полезный прогресс и обещанный результат. Некоторые задачи не имеют монотонной меры прогресса. Исследовательский агент может отказаться от слабой гипотезы и вернуться к более ранней стадии; это может быть ценной работой, даже если счетчик падает. Некоторые зависимости не показывают надежного срока. Некоторые результаты требуют суждения, а не проверки. В этих случаях сохранить доказательства и сообщить uncertain . Не изготавливайте точность с универсальным показателем здоровья. Также отделять онлайн проверки здоровья от офлайн оценки. Онлайн наборы данных могут показать, является ли новая версия агента более точной в известных случаях. "Жизненное окно здоровья" отвечает на другой вопрос: может ли этот конкретный этап достигаться, двигаться, законно ждать или не достигать результата сейчас? Обычно нужно и то, и другое. Начните с одного последовательного рабочего процесса. Определите один дельта прогресса и один детерминистический предикат результатов. Повторяйте известные работы, ожидания, застрявшие, недосягаемые и ложные случаи успеха. Только после того, как классификация соответствует действительности, от них должно зависеть предупреждение или ограниченное восстановление. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Его общественный сайт и система статей живы, но коллекция производственного агента здравоохранения, адаптеры запуска и восстановление, как правило, не доставляются. Направление продукта это слой здоровья, который облегчает действие границ доказательств, свежести, доверия и одобрения без замены рабочего времени агента. Основные ссылки OpenTelemetry: Семантические конвенции для агентов и рамки GenAI получен 24 июля 2026 года; статус документа: Развитие. Клод Код: Мониторинг официальные поля телеметрии и конфигурация, полученные 24 июля 2026 года. Кубернеты: оживленность, готовность и стартовые зонды официальные цели исследования и предупреждения о восстановлении, полученные 24 июля 2026 года.