2026-08-01T01:57:58.556Z
Datadog LLM Эксперименты наблюдения: Добавьте ворота продвижения
Отпечатки пальцев в сравнении, доказать охват рядов, сохранить действительные ожидания и заблокировать отсутствующие или дублирующие эффекты перед продвижением.
Эксперименты наблюдения Datadog LLM могут сказать вам, что архитектура кандидата, модели, поставщика или агента получила лучший результат и работала быстрее. Это полезные доказательства, но это еще не решение об освобождении. Разумным дефолтом является сравнение кандидата и базовой линии в рамках одного и того же проекта Datadog, закрепление версии набора данных, сохранение стабильности определений оценщиков и проверка распределения и следов, а не доверие к одному среднестатистическому. Затем добавьте небольшую рекламную дверь за пределами карточки: докажите, что каждый необходимый рекорд прошел, ожидаемые ожидания остались ожиданиями, мутирующие случаи получили точно один эффект, а завершенные случаи имеют расчетный номер. В этой статье этот последний шаг выполняется с помощью восьмизаписной фиксации. Кандидат переносит оценочный рейтинг с 75% до 100% и среднюю продолжительность с 980 ms до 738,75 ms . Продвижение все еще заблокировано. Одно возмещение не имеет подтвержденного квитанции на место назначения, а одно аннулирование имело два последствия. Сначала докажите, что два эксперимента сопоставимы. Обзор экспериментов Datadog описывает три основных операции: наборы данных версии, эксперименты и сравнение результатов. Нынешний документация по установке определяет эксперимент как задачу, выполняемую последовательно по записям наборов данных, с оценщиками записей и дополнительными оценщиками резюме. Внутренние задачи могут использовать те же декораторы отслеживания, что и код производства. Эти примитивы дают вам хороший материал для сравнения. Они не исключают необходимости определения того, что должно оставаться идентичным между двумя выездами. Перед тем как посмотреть на результаты, запишите без контента манифест: Хешы идентифицируют код оценщика; они не являются хэшами запросов, выходов, учетных данных или данных клиентов. Закрепите каноническую сериализацию JSON этого манифеста и прикрепите отпечаток к обеим записям эксперимента. Установка производит: Если отпечатки пальцев отличаются друг от друга, перестаньте называть результаты сравнением. Измененная версия набора данных может добавлять сложные случаи. Измененный оценщик может перенести порог. Отсутствующая запись может улучшить средний показатель, устранив неудачу, которая имеет значение. Эти изменения могут быть законными, но они требуют новой базовой линии. Пропуск продукции Datadog говорит, что наборы данных поддерживают управление версиями и могут быть прикреплены к конкретным версиям. Он также объясняет, что поверхность сравнения раскрывает средние показатели, распределение, задержка, стоимость, количество токенов, выходы и следы протяженности. Используйте все это. Манифест не заменяет доказательства Datadog; он предотвращает случайный дрейф сравнения, прежде чем вы его интерпретируете. Используйте ворота, которые могут не соглашаться с средними показателями Проверяемый артефакт для этой статьи стандартный библиотечный скрипт Python. Он содержит восемь синтетических записей без содержания и выпускает JSON. Попробуйте: Основное правило намеренно небольшое: Это не спрашивает второй модели, выглядела ли первая модель успешной. Он проверяет ясные поля, значение которых вы контролируете. Полная фиксация дает результаты: Измерение Исходная линия Кандидат : : Присутствующие записи 8/8 8/8 Пропускная ставка оценщика 75% 100% Средняя продолжительность 980 мс 738,75 мс Блокирование записей — 2 Решение о продвижении — Block Руководство разработчиков по оценке Datadog поддерживает результаты типовых оценщиков, необязательную оценку прохождения/неудачи, метаданные, теги и обобщенные оценщики. Это делает оценщика подходящим источником для evaluatorPass . Это не делает каждого оценщика проверяющим пунктом назначения. Если ваш оценщик сравнивает генерируемый текст с ожидаемым ответом, он может пройти, пока возврат никогда не достигает реестра. Держите эти улицы доказательств отдельно: EЛега оценки: Выход соответствовал выбранному правилу качества? Trace lane: Какой LLM, этапы извлечения, инструмента и задачи были выполнены, и с какими ошибками или задержкой? По состоянию: Работал ли случай, законно ждал, завершен, неопределен или нуждался в человеке? EEffect lane: Запланированная внешняя мутация произошла точно один раз? O выходной полоса: Содержит ли пункт назначения теперь обещанный результат? Первые две полосы являются естественными входами из экспериментов Datadog. Оставшиеся трассы поступают из вашего контракта на задачу, приборов и систем назначения. Вы можете представить их результаты в качестве настройки оценки или экспериментальных метаданных, но определить их на границе, которая принадлежит истине. Две заблокированные записи показывают разные провалы Запись issue refund имеет оценщик прохождения, состояние complete и один попытка эффекта. Его outcomeReceipt это missing . Это не свидетельствует о том, что возмещение не удалось, это свидетельствует о том, что завершение не подтверждено. Безопасный вердикт Uncertain , не зеленый и не автоматический повторный попыток. Запись cancel subscription имеет оценщика прохождения и проверенный квитанция назначения, но effectCount это два. Успешное окончательное состояние не устраняет дублирующий эффект. Кандидат заблокирован, потому что изменение ослабляет эффективность безопасности даже при улучшении совокупного результата. Запись approval required демонстрирует противоположную границу. Его ожидаемое состояние waiting , и кандидат предоставляет владельца, срок и токен продолжения. Он проходит. Пауза с известной зависимостью не является задержкой, поэтому ворота, которые требуют, чтобы каждый ряд заканчивался в complete , наказывали бы правильное поведение. Эти случаи намеренно неудобны. Если продвижение только повторяет оценку оценщика, оно не может изменить решение о выпуске. Полезные ворота должны быть в состоянии сказать: сравнение является недействительным из за изменения охвата записями; кандидат лучше по качеству, но опасен по эффектам; кандидату удается быстрее, но результат остался неизвестным; ожидание действует и не должно считаться провалом; доказательства противоречат друг другу, поэтому человек должен принять решение. Присоедините ворота к реальному эксперименту Datadog В текущем руководстве по установке Datadog требуется ddtrace =4.3.0 для документального пути Python Experiments и требуется как API ключ, так и ключ приложения. Сохраняйте эти секреты в переменных окружающей среды; не помещайте их в манифест, строку наборов данных, артефакт статьи или атрибут следа. Для существующего экспериментального рабочего потока, добавьте ворота в пять ограниченных шагов. 1. Закройте контракт на сравнение. Зарегистрируйте проект Datadog, идентификацию и версию набора данных, заказанные идентификаторы записей, хэши кода оценщика, пересмотр задач, конфигурацию кандидата и ожидаемое состояние для каждой записи. Сохранить только непрозрачные идентификаторы или хэши, когда контент чувствительный. 2. Сравнить покрытие перед расчетом ставки. Сравните ожидаемые идентификаторы записей с наблюдаемыми записями экспериментов. Лишние, дублированные или неожиданные удостоверения личности не сравнимы. Не сокращайте знаменатель до тех рядов, которые вернулись. 3. Выдача детерминистических полей на границе задачи. Для задачи, выполняемой только для чтения, получение может быть действительным для схемы ответом, связанным с ожидаемым пересмотром источника. Для мутирующей задачи используйте ключ "идемпотенци", идентификацию эффекта и поиск по направлению. Считайте, что произошло, а не попытки перепробовать. 4. Сохранить нетерминальные состояния. Ожидающий случай нуждается в причине, владельце, сроке и идентификации. Документ о удостоверении личности может закончиться как needs human . Не придумайте ответ, чтобы облегчить отсчет в автономном режиме. 5. Продвигать только в сочетании. Кандидат может быть продвинут, когда манифест соответствует, охват завершен, необходимые оценщики проходят, оперативные бюджеты сохраняются, каждое государство соответствует своему контракту, каждый завершенный результат проверяется, и каждый мутирующий случай имеет точно один намеченный эффект. Удельный вес средний не является заменой, потому что высокий балл может компенсировать математически один катастрофический эффект. Одна практическая политика заключается в следующем: Настройка порогов для оценки качества, задержки и затрат. Не оставляйте пропущенные квитанции, дублируемые эффекты, секретные экспозиции и недействительные сравнения как сложные неудачи, если ваша домена не предоставляет более безопасное прямое правило. Знать, что этот аудит не доказывает Эта система доказывает свои 8 случаев и выполнение правил. Это не доказывает, что ваш набор данных представляет собой производственный трафик, ожидаемые выходы являются правильными, хэши оценщика соответствуют пересмотренному коду, или не могут быть сфальсифицированы расписки назначения. Также она не измеряет качество продукции Datadog и не сравнивает модели. Эти вопросы требуют пересмотра наборов данных, контроля источников, контроля доступа, выборки образцов производства и согласования с реальным местом назначения. Эксперименты Datadog остаются местом для изучения экспериментальных запусков, распределений, следов и результатов оценщиков. Продвижение портал добавляет более узкое оперативное решение: это конкретное сравнение достаточно полно и безопасно, чтобы разрешить изменение? Направление продукта Sidewisp заключается в том, чтобы сделать доказательства здоровья агента, неопределенность и проверку более легкими для интерпретации в течение существующих сроков эксплуатации. Он не заменяет Datadog, время выполнения или процесс выпуска. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Общественное место и интерактивная демонстрация находятся в прямом эфире; коллекция продуктов агентов и интеграция Datadog обычно не отправляются.