2026-08-01T14:17:50.620Z

LLM Самооценка: до того, как доверять судье, проанализируйте его

Направьте каждое вердикт на детерминистические доказательства, на определённые критерии калиброванного судьи LLM или ответственного человеческого обзора.

Самооценка LLM полезна, когда критерий действительно качественный, оценщик был протестирован против человеческих ярлыков на то, что именно критерий, и его ответ рассматривается как подтверждающее доказательство. Он не должен решать, существует ли файл, совершается ли платеж, проходит ли тест или разрешается ли лицо совершить необратимое действие. Эти вопросы уже имеют более сильных владельцев: детерминистические проверки или ответственные люди. Таким образом, практическим дефолтом является маршрутизатор, а не универсальный судья. Отправить механически проверяемые претензии к коду. Отправить ограниченные качественные критерии калиброванному оценщику модели. Передай человеку неопределенные, нестабильные или сильно влияющие решения. Если доказательства отсутствуют, вынесите вердикт unknown . Судья LLM может быть полезным , не будучи авторитетным . Самооценка означает просьбу LLM оценить собственную выпускную способность или выпускную способность другой модели. Второй проход может обнаружить очевидный противоречие, сравнить два резюме или оценить ответ по одной рубрике. Узнай обзор проспекта показывает основной шаблон: генерировать ответ, затем попросить модель критиковать или пересмотреть его. Исследования дают этому образцу достоверную, но ограниченную роль. Рен и его коллеги реформулировал открытую самооценку как прогнозы на уровне токенов и сообщил о лучшей точности селективного поколения и более сильной корреляции с качеством выхода на TruthfulQA и TL;DR для их проверенных настроек PaLM 2 и GPT 3. Недавнее исследование многоэтапных задач показало, что поэтапная самооценка превосходил целостные оценки обнаружения неисправностей на двух наборах данных сбалансированных показателей, с относительным увеличением AUC ROC до 15%. Ни один из этих результатов не превращает образцовое мнение в квитанцию доставки. Они показывают, что самооценка может улучшить решение по конкретным задачам, запросам, моделям и наборам данных. Единство доверия это проверенная конфигурация оценщика, а не фраза "LLM судья". Также существуют известные режимы сбоев. В газете MT Bench и Chatbot Arena сообщается, что сильные судьи достигли более 80% согласия с человеческими предпочтениями в его обстановке, документируя позицию, вербоспособность, самосовершенствование и предвзятость рассуждения. Согласие поощряет, список предвзятости имеет решающее значение. Судья может быть полезен в среднем и все равно отменить один важный приговор. Позиционное предвзятость легко проверить. Оценить кандидатов А и Б, заменить их заказ, не изменяя их содержание, и опять оценить. Ван и его коллеги показал, что изменения порядка могут существенно изменить пары рейтингов и предложили калибровку сбалансированной позиции плюс человеческую эскалацию. Если после обмена выбранный кандидат меняется, запишите unstable . Не перечисляйте противоречия в уверенный результат. Замораживать критерий перед калибровкой судьи "Качество" слишком широкое для калибровки. Судья, который признает четкое резюме, может по прежнему быть ненадежным по фактам, интерпретации политики или достаточности доказательств. Определите один критерий с узким контрактом: Набор калибровки требует примеров, которые оценщик не написал, ярлыков от людей, которые владеют критерием, и достаточно сложных негативов, чтобы выявить льстивое или чрезмерно допустимое оценивание. Заморозите идентификатор модели, прокат судьи, рубрику, примеры, исходный анализатор и порог вместе. Изменение в любой из них создает новую версию оценщика. Этикетки человека не являются позором в этом процессе; они определяют цель. Авторы EvalGen описывает "дефлирование критериев": люди часто уточняют то, что они имеют в виду по критерию после того, как видят реальные результаты. Это причина для критериев версии и ярлыков, а не причина для скрытия суждения за результатом модели. Измерить по крайней мере эти свойства в зависимости от критерия: соглашение о запрещении использования устаревших человеческих ярлыков; процент ложных результатов, потому что оценщик, одобряющий плохой результат, создает ложный успех; ставка unknown , которая показывает отсутствие покрытия; стабильность при изменении кандидата и неуместной форматировки; охват по языку, семейству задач, классу воздействия и длине выхода; кластеры разногласий, сохранившиеся в качестве примеров для следующего пересмотра. Не объединяйте не связанные критерии в один успокаивающий средний показатель. Предположим, что ясность на 100% согласна, основательность на 75%, а безопасность имеет только два типа примеров. Смешанный показатель 88% может скрыть отсутствие защитных шлюзов безопасности. Держите три ряда отдельно. Предел это выбор политики, а не константы из бумаги. Команда может принять 80% согласия для предложения о стиле с низким воздействием и потребовать детерминистического доказательства эффекта развертывания. Важное свойство заключается в том, что порог заморожен до того, как кандидат в высвобождение получит баллы. Перезагрузить калибровочные ворота В следующей фиксации используются четыре критерия и восемь маршрутизационных случаев. Его порог преднамеренно прост: по меньшей мере три человека маркированные примеры, по меньшей мере 80% согласия, и никаких изменений победителя при обращении порядка. Правило принятия решений небольшое: Используйте полную установку с помощью: Воспроизведение производит: Два наблюдения важны больше, чем компактные числа. Во первых, на фиксированном устройстве есть отсутствующий документ, который судья называет pass . Раутер возвращает детерминистический fail . Он также содержит совпадение суммы проверки, которое судье не нравится; маршрутизатор возвращает детерминистический pass . Модель может комментировать презентацию, но она не может отменить доказательства о том, существует ли обещанный объект и соответствует ли он. Во вторых, качество в паре имеет идеальное согласие на четырех маркированных примерах, но меняет своего победителя, когда кандидаты обмениваются порядком. Ворота все еще не работают. Историческое согласие не оправдывает нынешнего противоречия. Это небольшое воспроизведение не является доказательством того, что 80% безопасно для вашего приложения. Это проверяемая модель для доказательства того, что каждый приговор достиг правильного владельца доказательств. Направьте решение на живую к самому сильному владельцу доказательств . После прохождения калибровки решение о времени выполнения должно сохранить три полосы. Deterministic lane. Используйте проверки файловой системы, проверку схемы, результаты испытаний, ограничения базы данных, квитанции поставщика, подписи, суммы проверки и чтение пункта назначения, когда они могут ответить на вопрос напрямую. Запишите наблюдаемое значение и свежесть. Команда, выходящая из нуля, доказывает только договор этого команды; проверьте предполагаемый внешний результат отдельно. Помощная полоса. Используйте закрепленный оценщик для таких критериев, как ясность, релевантность, тонус или соответствие рубрикам, когда охват калибровки соответствует текущему случаю. Сохранить критерий, версию оценщика, хэшинг запроса, справку ввода, вердикт, объяснение и версию калибровочного набора. Модель поддерживает вердикт; окружающая политика решает, что это доказательство позволяет. Human review lane. Маршрут высокоэффективных разногласий, новых языков, раскрытых семей задач, нестабильности порядка, исключений в политике и необратимой власти здесь. Включите противоречивые доказательства и конкретный вопрос. "Пожалуйста, пересмотреть" это слабый маршрутизатор; "Детерминистическая квитанция отсутствует, пока судья говорит, что завершеныможет ли этот инцидент быть закрыт?" это действенное. Результат unknown полезен. В нем говорится, что система в настоящее время не может установить претензию. Превращение неизвестного в пропускное средство просто защищает панель от неполного внешнего вида. Рекалибровывать на дрейфе, а не только на календаре Судья может дрейфовать, когда прозвище модели меняется, запрос редактируется, примеры перепорядочены, приходит новый язык, выходы становятся длиннее или продукт начинает обрабатывать другую семейство задач. Перекалибровывать эти изменения и отслеживать живые образцы несогласия между запланированными пересмотрами. Держите две границы в виду: 1. Самооценка оценивает ограниченное качественное свойство; она не доказывает доступность, полезный прогресс, эффекты инструмента, стойкость памяти или доступа к существованию. 2. Калибрированный оценщик уменьшает нагрузку на обзор; он не получает человеческий авторитет над секретами, расходами, публикацией, удалением или другими необратимыми действиями. Результатом является менее театральная форма оценки AI. Судья получает полезную работу, детерминистические доказательства сохраняют свою сильную работу, и люди сохраняют решения, которые принадлежат им. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Он разрабатывается как слой здоровья вокруг существующих сроков работы агентов, но сбор и восстановление продуктов агентов здоровья не отправляются в текущем хранилище веб сайта. Если эта проблема с маршрутизацией доказательств совпадает с тем, как вы управляете агентами, вы можете присоединиться к списку ожиданий для частного просмотра, не рассматривая статью как требование интеграции мониторинга в режиме прямого действия.