2026-07-31T20:58:47.792Z

Splunk LLM Наблюдаемость: Держите вызовы оценщика вне здоровья агента

Проверка Изоляции оценщика Splunk, телеметрии гистограммы, охвата выборки образцов, кардинальности, захвата контента и доказательства результатов, прежде чем доверять визуальному эффекту зеленого агента.

Наблюдаемость Splunk LLM может показать полезную производительность, качество, токен, расчетную стоимость и следные данные для инструментированного агента. Однако безопасным операционным дефолтом является отсутствие заполненной страницы AI Agents, поэтому агент является здоровым. Этот справочник строит этот доказательство, не собирая запросов или ответов. Включенная фиксация из восьми случаев производит безсодержательный прием, и маршруты каждый отправляется в одно из этих государств: потребление неполным, несоответствие метрических контрактов, самонаблюдаемый оценщиком, риск высокой кардинальности, обзор политики содержания, снижение охвата оценок, наблюдаемое, но не проверенное, или здоровое с охваченными и проверенными доказательствами. Провести аудит пути измерения перед чтением оценки Нынешняя документация по установке Splunk делает две телеметрические данные оперативно важными. Во первых, для страниц по мониторингу агента AI требуются показатели гистограммы. Если используется экспортер SignalFx, документальная установка коллектора send otlp histograms: true . Настройка также определяет дельта временность через: Видимый след не доказывает, что этот метрический путь является правильным: протяженности и гистограммы могут провалиться самостоятельно. Во вторых, инструментация Python AI может выполнять оценки в том же процессе, что и приложение. Splunk документирует этот переключатель, дефолт которого неверный: В этом режиме по умолчанию звонки LLM, выделяемые оценщиками, такими как DeepEval, могут быть использованы наряду с звонками приложения. Настройка на верные оценки выполняется в детском процессе с отключенным SDK OpenTelemetry, что предотвращает загрязнение телеметрии приложений при звонках оценщика. Splunk отмечает эту изоляцию в соответствии с требованиями для инструментации OpenAI, когда оценки включены и являются опциональными для других документальных рамок. Это различие меняет значение диаграммы. Предположим, что один агент призыв звонит модели дважды, а затем один оценщик делает еще три модели звонков. Если оценщик разделяет инструментированный процесс, наивный агрегат может сообщить о пяти звонках, их комбинированных токенах и их комбинированной задержке. Дополнительная активность это реальная вычисление, но это не свидетельствует о том, что агент сделал больше прогресса. Это измерение работы, наблюдение измерения работы. Зарегистрируйте бесплатную квитанцию на развертывание: Ни одно из этих полей не требует запроса, ответа, инструментального аргумента, секрета или идентификатора клиента. Они описывают состояние трубопровода доказательств. Первые три проверки отвечают на разные вопросы: histogramsExported : экспортировал ли коллектор телеметрию гистограммы, требуемую для страниц мониторинга AI? deltaTemporality : соответствует ли контракт на показатели документальной конфигурации? aiSpanVisible : достиг ли хотя бы один новый размах GenAI ожидаемого вида Splunk? Не слагайте их в одну булевую формулу telemetry ok . Если прибывают диапазоны, но гистограммы не прибывают, исследование следов может работать, в то время как агрегированные панели остаются неполными. Если данные устарели, заполненная страница может быть устаревшей. Сохраняйте источник доказательств и время наблюдения рядом с получением в реальном исполнении. Приведите каждому качественному баллу знаменатель охвата Splunk описывает оценку качества агента AI как процент оценок, которые прошли за метрику. В документации AI Agents говорится, что для вычисления этих баллов пробку пробирают, а результат ниже 80% указывает на проблему качества. Это может быть полезным правилом для оцениваемой выборки. Это не является само по себе доказательством того, что каждое допустимое обращение было оценено или что образец представляет каждый тип задачи. Следите за четырьмя цифрами вместе: 1. допустимые сроки подачи заявок; 2. конфигурированный уровень оценки образцов; 3. завершенные результаты оценки; 4. снижение очереди оценки. Для детерминистического аудиторского окна вычислить: При 400 допустимых периодах, 0,25 процентных показателей, 100 оценок и нулевых падений наблюдаемое охватное обеспечение составляет 25% и соответствует конфигурированным ожиданиям. Это означает, что Znot означает, что остальные 300 затягивания прошли. Это означает, что состояние их оценки находится вне образца. Конфигурация Python Splunk также показывает размер очереди оценки. Положительная линейка применяется к обратному давлению; когда очередь заполнена, новые элементы выпадают с предупреждением. Документация рекомендует ограничение в диапазоне 1001000 в зависимости от пропускной способности и памяти, в то время как нулевая или не установленная очередь оставляет очередь неограниченной. В любом выборе есть компромисс: неограниченная очередь может превратить задержку оценки в давление памяти; Ограниченная очередь может сохранить процесс, но сократить охват оценки; Счетчик отметки в очереди из шести означает, что 94 завершенные оценки не могут достоверно заменить 100 допустимых оценок по ставке 100% выборки. В результате аудита возвращается EVALUATION COVERAGE DROPPED , не здоровый и не неудачный агент. Агент, возможно, завершил полезную работу; доказательства, необходимые для определения качества, неполны. Для метрических измерений необходима аналогичная граница. Splunk позволяет копировать контекстные атрибуты GenAI в метрические измерения, но явно предупреждает, что gen ai.conversation.id может вызвать проблемы с высокой кардинальностью. Сохраняйте идентификацию за разговором на диагнозе, когда это необходимо для диагностики. Не превращайте его автоматически в метрический размер. Окружающая среда развертывания с низкой кардинальностью или уровень арендаторов обычно безопаснее для агрегации; правильный набор все равно зависит от ограничений трафика и арендаторов. Сохранить контент запечатлеть явный исключение В документации службы Splunk LLM говорится, что сбор запросов и ответов отключен по умолчанию и предупреждает, что контент может содержать конфиденциальную или лично идентифицируемую информацию. Его маршрут установки также отмечает, что большие захваченные входы и выходы могут превышать лимиты бэкэнда и вызывать проблемы с производительностью. Этот аудит не нуждается в содержании. Он может проверять экспорт гистограммы, временность, изоляцию процессов, выборку образцов, капли, размеры, видимость следов и расписку назначения, используя только метаданные. Если отдельное расследование качества действительно требует зафиксированного контента, направьте его через обзор политики контента: определять точного оценщика, которому необходим контент; указывают, происходит ли захват на протяжении, событиях или обоих; хранение документов, доступ к ним, маскирование и удаление; испытание поведения по размеру полезной нагрузки; проверять, что определения инструмента не записываются просто потому, что запись сообщений была включена; отключить улов после ограниченного расследования, если непрерывный сбор не оправдан. Примечание возвращает CONTENT POLICY REVIEW , когда захват включен без квитанции на одобрение. Этот приговор намеренно ни здоровый, ни нарушенный. В нем говорится, что инструментация перешла границу данных, которую проверка оперативного здоровья не может разрешить. То же ограничение применяется и к предполагаемым затратам. Splunk заявляет, что оценка стоимости агента умножает стоимость опубликованного поставщика на количество доступных токенов и не представляет собой фактическое расчет. Ознакомьтесь с оценкой, сохраняйте дату ценообразования и не согласуйте ее молча с счетом или специальной кешированной скидкой для поставщика. Провести проверку на 8 случаев доказательств Репродуктивный артефакт использует одно правило преимущества. Ранние выводы блокируют более поздние зеленые состояния: Запустить сохраненное устройство: В нем пересматриваются восемь случаев и возвращаются восемь различных результатов: Закрытые и проверенные HEALTHY COVERED VERIFIED : Требуемая телеметрия, декларированная выборка, нулевые капли и согласование результатов. Evaluator self observed EVALUATOR SELF OBSERVED : Звоны судьи могут входить в телеметрию приложения. гистограммы отсутствуют INGESTION INCOMPLETE : Следы не доказывают, что необходимые показатели прибыли. Z неправильно временность METRIC CONTRACT MISMATCH : Экспортируемый метрический контракт отличается от документальной установки. conversation id as metric HIGH CARDINALITY RISK : Идентичность за разговором была продвинута в метрическое измерение. Содержание заимствование неанализированные CONTENT POLICY REVIEW : Без квитанции была пересечена граница конфиденциальных данных. Оценка в очереди EVALUATION COVERAGE DROPPED : 94 результаты не могут представлять ожидаемого 100. Trace without outcome OBSERVABLE NOT VERIFIED : Доказательства исполнения существуют, но обещанный результат не существует. Это синтетический аудит на конфигурацию, а не тест на соответствие Splunk. Он не может доказать, что коллектор доступен, роль включает необходимые возможности, хранение охватывает окно инцидентов или место назначения содержит ожидаемое добытое. Заменить значения фиксации наблюдениями из окружающей среды и сохранить unknown , когда значение не может быть измерено. Прекратите следы до приговора о здоровье. Следы Splunk и взгляды на взаимодействие AI отвечают на важные вопросы о модельных операциях, ошибках, использовании токенов, задержке и качестве оценки ответа. Приговор о здоровье агента имеет еще одну границу: было ли выполнено запрашиваемое дело? Выберите наиболее мощный детерминированный контроль назначения: файл существует на ожидаемом пути и соответствует схеме или хэши; в ожидаемом хранилище есть запрос по снятию и обязательство; на предназначенном пункте назначения имеется сообщение с ключем ожидаемой независимости; мутация базы данных видима под идентификатором предполагаемого арендатора и оператора; испытательный комплект, прошедший на произведённом артефакте; Человеческое одобрение все еще pending, так что пробег waiting , не провалился. Присоедините к отслеживаемому квитанции с минимальным идентификатором. Сохраняйте доступный контент в его источнике. Успешный промежуток времени плюс отсутствующий квитанция OBSERVABLE NOT VERIFIED ; это не автоматическое разрешение на повторную попытку, потому что внешний эффект может существовать, но временно нечитаемый. Практическое правило простое: доверяйте взгляду Splunk после прохождения собственного пути измерения, интерпретируйте оценки качества в пределах их известного охвата, и ясно здоровье агента только тогда, когда предполагаемый результат проверяется отдельно. Sidewisp следует тому же направлению, которое следует за продуктами, основанными на доказательствах: различать деятельность от полезного прогресса, выявлять отсутствующие доказательства и держать проверку результатов отдельно от завершения работы. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Его адаптеры мониторинга производства и двигатель восстановления не представлены здесь как общедоступные; на общедоступном сайте представляется опыт раннего доступа и демонстрация продукции. Источники Настройка AI Мониторинг агента, Спланк Наблюдаемость облака документации. Настройка агента Python для приложений AI 0.1.14 и выше, Спланк Наблюдаемость облака документации. Наблюдение за агентами AI, последний раз обновлен 16 июня 2026 года. Мониторинг услуг LLM, последний раз обновленный 12 мая 2026 года.