2026-08-01T09:31:02.412Z
MLflow LLM Оценка: Добавьте шлюз для выпуска данных в режиме работы
Воспроизведите путь оценки MLflow, а затем добавьте четыре расписки за время запуска, чтобы проходящий балл не стал ложно-зеленым вердиктом агента.
Оценка MLflow LLM может показать, соответствуют ли результаты заявки критериям, которые вы выбрали. Она сама по себе не может доказать, что агент был доступен, начался вовремя, завершил внешний побочный эффект или оставил обещанный продукт на месте назначения. Практическое дефолт заключается в том, чтобы сохранить результат оценки MLflow и вердикт о состоянии здоровья в режиме эксплуатации в качестве двух слоев доказательств, а затем потребовать обоих до выпуска. Я проверил эту границу с помощью MLflow 3.14.0. Кодовый бомбардировщик дал трём агентам идеальный exact deliverable/mean 1.0 . По отдельному правилу здоровья с четырьмя квитанциями разрешалось проходить только одно из этих поездок. Разница была не в недостатках в MLflow. Это было несоответствие между вопросом, на который ответил бомбардир, и более широким оперативным решением. Воспроизвести документированный путь оценки MLflow Нынешнее руководство по оценке MLflow определяет оценку из трех компонентов: набор данных, один или несколько баллов и опциональная функция прогнозирования. Набор данных предоставляет информацию и ожидания. Функция прогнозирования генерирует выходы, когда они еще не присутствуют. Скорьеры преобразуют доступные доказательства в обратную связь или метрику. Это разделение полезно, потому что делает вопрос об оценке ясным. Если вопрос Разве этот выход равен ожидаемому полученному названию?, детерминистический счетчик на основе кода более подходящий, чем судья LLM. MLflows документация для пользовательских баллов позволяет бомбардировщикам читать inputs , outputs , expectations или полный след, и возвращать примитивный результат или более богатый Feedback . В эксперименте использовался встроенный список, предварительно генерируемые результаты, и этот счетчик: MLflow зафиксировал exact deliverable/mean = 1.0 . Это правильный результат для определенных доказательств: каждая выходной последовательность соответствовала ожиданиям. Результат воспроизведен, дешевый и легко объясняемый. Он также более узкий, чем все три агента являются здоровыми. MLflows документация набор данных оценки описывает наборы данных как выбранные примеры для предотвращения регрессии, сравнения версий и целенаправленного тестирования качества. Это правильная ментальная модель. Набор данных это тест свитка для заявлений, кодированных в его примерах и оценках; это не автоматически перепись всех неудач в производстве, что имеет значение. Поставьте операционные расписки рядом с результатом оценки То же устройство присоединяло к каждой задаче небольшой расчетный счет. В нем были зафиксированы четыре факта, которые точной оценщик результатов не проверял: heartbeatFresh : время выполнения может быть достигнуто в последнее время; scheduleOnTime : ожидаемое движение началось в пределах допустимого периода; effectVerified : внешний пункт назначения подтверждает предполагаемый побочный эффект; deliverableVerified : обещанный артефакт существует и проходит проверку назначения. Результатом было сравнение: Задача Точная доставка Доказательства времени выполнения Решение об освобождении run 101 пропуск все четыре квитанции присутствуют освобождение run 102 пропуск устаревшие сердечные сокращения; эффект и результат не подтверждены блок недоступен run 103 пропуск расписание пропустило разрешенное окно Блок как поздно Все три ряда оценки прошли. Только одна побега была возможна. Правильная струна может выжить в кешевом ответе после исчезновения работника. Правильная полезная нагрузка может прибыть после рабочего срока. Призыв к инструменту может возвращать достоверное подтверждение, пока место назначения остается неизменным. Ни одно из этих случаев не отменяет оценку результатов; они демонстрируют, почему решение об освобождении требует дополнительных доказательств. Сохраняйте слои, соединенные стабильным task id или run id , но не разбивайте их в одну неясную партию. Компактная запись может выглядеть вот так: Ключевое значение имеет соединение. Без него команда может сравнить текущий медицинский квитанция с оценкой из другой версии, окружающей среды, или попробовать снова. Включите версию приложения, версию набора данных, версию сборника, окружающую среду и время наблюдения, когда эти измерения могут изменить приговор. MLflow может хранить оценку и отслеживать доказательства; время выполнения или место назначения должны все же предоставлять факты, которые могут быть известны только ему. Пропавшие доказательства следует рассматривать как unknown , а не как pass . Отсутствие сердечного сокращения может означать неисправность коллектора, а не неисправность агента. Отсутствие квитанции по месту назначения может означать, что запись не удалась, проверяющий не удалось или интеграция не может выявить факт. Эти государства требуют расследования; они не оправдывают "зеленого" выпуска. Используйте решение с двумя воротами вместо одного смешанного результата Практическое правило освобождения намеренно скучно: Каждый пункт должен сохранять свои собственные доказательства, свежесть и причину неудачи. Это дает оператору ограниченное следующее действие: Провал оценки возвращается к запросу, модели, политике инструмента, набору данных или оценщику. Старый сердечный ритм направляет к диагностике или сборщику. Пропущенный расписание маршрутов к расписателю, очереди, или пределы емкости. Непроверенный эффект блокирует повторные попытки до согласования внешнего пункта назначения. отсутствующие маршруты доставки к производителю или проверяющему пункту назначения. Это разделение также препятствует судье LLM стать органом, которым он не был предназначен. Судьи ценны, когда правильность или качество требуют семантической оценки. MLflow явно поддерживает встроенные, ориентировочные, пользовательские и кодовые носители баллов. Используйте эти инструменты для их установленных критериев. Предпочтительно проверять детерминированные направления на наличие файлов, состояние базы данных, ресурсы API, результаты испытаний или подписанные квитанции. Не читайте эксперимент, так как MLflow не имеет мониторинга производства. Оценка документов MLflow, следы, мониторинг, наборы данных, обратная связь и несколько типов баллов. В более узком смысле заключение может быть сфальсифицировано: точная оценка, проведенная здесь, не установила четырех оперативных фактов, потому что ее данные и оценщик не проверили их. Вы можете добавить ориентированные на здоровье баллы, когда имеются соответствующие доказательства, или сохранить классификатор здоровья рядом с MLflow, когда доказательства живут в режиме выполнения и внешних системах. Установка умышленно маленькая. Он не сравнивает судей LLM, не проверяет MLflow в масштабе, не сравнивает поставщиков и не измеряет охват мониторинга. Его значение контролируемое несоответствие: три идентичные оценки, три различные состояния работы и одно проверяемое правило, объясняющее решение о выпуске. Для команд, работающих с агентами, эта граница является полезной: оценить качество выпуска с помощью наиболее сильного соответствующего балла, проверить операционные факты в их источнике и объединить доказательства, прежде чем объявить успех. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Его запланированная роль это слой здоровья наряду с существующими сроками работы, а не замена MLflow или автоматическое заявление о том, что проходящая оценка означает здоровый агент. Нынешний опыт общественности это сайт раннего доступа и демонстрация продукции; адаптеры мониторинга производства обычно не поставляются.