2026-08-01T01:58:06.173Z

Honeycomb LLM Наблюдаемость: аудит контракта о сроке действия агента

Проверяйте группировку разговоров, присвоение агентов, корреляцию инструментов и распространение ошибок перед тем, как доверять Timeline агента Honeycomb.

Медведь может показать полированную временную линию агента и все еще работать из нарушенного договора на событие. Перед тем как использовать этот вид для диагностики инцидента с многоагентами, проверьте шесть вещей в выпущенных интервалах: один идентификатор разговора, различные имена агентов, атрибуция призыва со стороны звонка, признанные имена операций, стабильные идентификаторы инструмента при звонке и распространенные ошибки. Практический тест это не прибыла ли телеметрия? Это Могли бы эти поля проецировать работу в правильный разговор, маршрут агента, режим работы и состояние неисправности? Ниже приведенный аудит отвечает на этот более узкий вопрос с восемью контент свободными фиксаторами. Znot собирает запросы или утверждает, что чистый временной диапазон доказывает запрашиваемый внешний результат. Что на самом деле прогнозирует Agent Timeline из Honeycomb Медоносная корова документирует агентскую временную линию как вид на целые разговоры, которые могут охватывать несколько следов. Ключ к разговору gen ai.conversation.id . В рамках разговора объемы GenAI группируются по gen ai.agent.name , затем представлены в виде агентских запросов, операций LLM и инструментальных вызовов по gen ai.operation.name . Это делает вид полезным, но также делает несколько областей, предоставленных приложениями, частью диагностической границы: gen ai.conversation.id решает, к каким пространствам относятся. gen ai.agent.name решает, кто из агентов владеет полосой. gen ai.operation.name решает, рассматривается ли промежуток времени как чат, запрос агента или исполнение инструмента. gen ai.tool.call.id позволяет оператору коррелировать запрос инструмента с его результатом. Поле состояния ошибки и исключения определяют, видит ли неисправность в пораженном интервале и его родительском. Инструментационный справочник Honeycomb указывает идентификатор разговора, имя агента и название операции, как это требуется для его зрения агента. В нем также говорится, что отсутствующее имя агента появляется как Unknown , и что дублированные имена мешают операторам отличать агентов во время расследования. В этом же руководстве четко указано правило присвоения, которое легко пропустить: агент calling излучает промежуток времени invoke agent . Призыванный агент выпускает свой собственный chat , execute tool и другие спены под своим собственным уникальным названием. Если коллекторская трансформация присваивает призыв к звонку, временная линия может содержать каждый промежуток времени, но рассказывает неправильную причинно следственную историю. Это проблема с схемой соответствия, прежде чем это проблема панели управления. Более сложные запросы не позволяют восстановить идентичность, которая никогда не была выпущена, или исправить имя агента, которое разделяют два работника. Проверка контракта на проектирование до инцидента Сопроводительное устройство содержит восемь небольших наборов протяженности. Ни одна из них не содержит запросов, ответов, аргументов инструмента, идентификаторов клиентов или секретов. Единственными значениями являются синтетические идентификаторы разговоров, инстанции агентов, имена агентов, имена операций, родительские ссылки, идентификаторы инструмента звона и поля статуса. Проводить аудит из справочника предметов: Классификатор применяет проверки в причинном порядке: 1. Все участники предлагаемого разговора должны иметь единый идентификационный номер. 2. Каждое место должно иметь имя агента. 3. Одно отображаемое имя агента не должно принадлежать к нескольким экземплярам агента. 4. Заказчик должен владеть спином invoke agent . 5. Операция должна принадлежать к документированному набору операций GenAI, используемому проекцией. 6. Продолжительность execute tool должна сохранять идентификатор инструмента для вызова. 7. Дети, совершающие ошибку, не должны быть ниже родителей, которые все еще сообщают о успехе. Порядок имеет значение. Если один разговор уже разделен на conv 201 и conv 202 , подсчет полос агента внутри любого фрагмента дает точный ответ на неправильный вопрос. Аналогичным образом, если два процесса называют себя worker , корреляция инструмента позвона не может восстановить отсутствующую идентичность агента. Правила намеренно более строги, чем Honeycomb rendered something. Оценка представляет собой наблюдение. Конформирующий обхват является доказательством того, что наблюдение было группировано и присвоено в соответствии с заявленным контрактом. Восемь светильников показывают семь различных ложных зеленых Наивное правило сравнения проверяет только то, что у каждого периода есть идентификатор разговора. Он принимает все восемь вариантов, включая случай, когда два различных непустых идентификатора разделяют один логический разговор. Аудит соответствия принимает именно одно: Фиксация Проверка идентификации наивных Приговор о соответствии Необходимый ремонт действительный разговор пропуск CONFORMANT Никаких фрагментированный разговор пропуск FRAGMENTED CONVERSATION распространять один идентификатор разговора через границы следов неизвестный агент пропуск UNKNOWN AGENT выдать стабильное, не пустое название агента агент имя состязание пропуск AGENT NAME COLLISION дать каждому агенту отдельное оперативное название ошибочное призыв призначение пропуск INVOKE ATTRIBUTION INVALID выпускает invoke agent от звонка Непризнанная эксплуатация пропуск OPERATION UNRECOGNIZED переоформление на документированную операцию GenAI отсутствующий инструмент свидетельство пропуск TOOL CALL UNCORRELATED сохранить идентификатор звонка по запросу и результату Дети ошибки скрытые пропуск ERROR PROPAGATION BROKEN распространять статус неисправности на родителя Каждый приговор защищает другое решение оператора. Расколный разговор скрывает работу. Неизвестное или ссоримое имя испортит собственность. Неправильное присвоение призывов обращает внимание на то, кто кому делегировал. Непризнанная операция вводит событие в неправильную визуальную категорию. Отсутствие идентификатора вызова делает перерыв опасным для примирения. Скрытая детская ошибка превращает неудачный инструмент в успешного родителя. Последний случай заслуживает особого внимания. Honeycomb советует систематически записывать ошибки и распространять неисправность призыва инструмента на родительский промежуток времени. Такое распространение не доказывает, совершается ли внешний побочный эффект; оно не позволяет родителю молча оставаться зеленым, пока известно, что ребенок потерпел неудачу. Для эффективных инструментов после проверки телеметрии добавьте отдельный квитанцию назначения. Время отсрочки плюс отсутствие ответа это неопределенный эффект, а не разрешение на повторную попытку. Временная линия агента может помочь определить двусмысленный вызов; авторитетный пункт назначения должен решить, существует ли эффект. Превратить аудит в канарию развертывания Сначала запустите устройство на местном уровне, а затем приспособите одно безобидное канарское разговоры к вашему инструментационному пути. Сохраняйте канарное содержание свободным и делайте его топологию очевидной: один агент маршрутизатора призывает одного работника; работник выполняет один безобидный звонок инструмента; каждой ссылке присваивается тот же синтетический идентификатор разговора; маршрутизатор и работник имеют разные названия; призыв принадлежит маршрутизатору; призыв к инструменту сохраняет один синтетический идентификатор призыва; один из вариантов испытаний намеренно не работает с инструментом и проверяет, что родительский вариант больше не имеет успеха. Сравните выпущенный конверт до экспорта и после любой трансформации OpenTelemetry Collector. Это обнаруживает общую граничную ошибку: исходная инструментация корректна, но переименование трансформации охватывает, выпускает атрибут или присваивает каждому процессу одно имя статического агента. Запиши эту трансформацию. Семантические конвенции агента OpenTelemetry GenAI, проверенные для этой статьи, маркированы Development , поэтому обновление SDK или Collector не является рутинным визуальным изменением. Это изменение схемы, которое должно перезапустить канар. Используйте небольшую запись приема для каждого выпуска: Не указывайте в данную запись запросы, ответы, аргументы инструмента или результаты инструмента. Honeycomb отмечает, что контент сообщения может содержать PII и рекомендует помещать такой контент в события, где коллектор может его фильтровать. Канарю соответствия нужны идентичности и статус, а не контент разговора. Где этот тест останавливается Прохождение аудита означает, что поставленный объем может последовательно проецироваться в временной шкале агента Honeycomb. Он не устанавливает, что: Каждый раз, когда он достиг Медвежьего роста; выбор проб сохранил критическую неисправность; агент делает полезный прогресс; законное человеческое ожидание имеет владельца и срок; побочный эффект инструмента, совершенный ровно один раз; обещанный файл, билет, развертывание или отчет существует; ответ является фактически или семантически правильным. Это отдельные вопросы здоровья. Смотрите на соответствие срокам как на входный билет для диагностики, а не на окончательный судебный приговор. После того, как он пройдет, добавьте свежесть, состояние ожидания, эффект и результаты, в зависимости от риска рабочего процесса. Этот предел также объясняет, почему эксперимент в статье не сравнивает Honeycomb с другим продавцом. Решение читателя было более ранним и конкретным: Могу ли я доверять разговору и приписыванию агента, который я собираюсь расследовать? Sidewisp сейчас находится на этапе закрытого предварительного доступа. Он предназначен для добавления слоя здоровья вокруг существующих сроков запуска агентов, но коллекция производственного агента здравоохранения, адаптеры Honeycomb и автоматическое восстановление не отправляются в текущем хранилище веб сайта. Если вы определяете границу доказательств для своих агентов сейчас, лист ожидания для частного предварительного просмотра является подходящим способом для того, чтобы поделиться этой потребностью в интеграции. Источники Медонос: инструментальные агенты AI Медведь: Агент Таймлайн OpenTelemetry Семантические конвенции агента GenAI при проверенном обязательстве