2026-08-01T14:17:51.326Z
LLM 自我评价: 相信法官之前,先调整判断力
通过确定性证据,标准特定的LLM评判者或负责的人类审查.
如果标准是真正的质量性,评估者已经对人类标签进行了对该标准的测试,其答案将被视为支持证据时,LLM自我评估是有用的. 它不应该决定是否存在文件,是否已登陆付款,是否通过了测试,或者是否有权授权不可逆转的行动. 这些问题已经有更强大的主持人:确定性检查或负责任的人. 因此,实际的默认是路由器,而不是通用判断器. 通过机械验证的索赔发送给代码. 向校准模型评价者发送有限的质量标准. 给一个人发出未知,不稳定或具有影响力的决定. 如果没有证据,请保留判决. unknown . 一个LLM法官可以在没有权威的情况下是有用的 自行评估意味着要求LLM评估其自己的输出或其他模型的输出. 第二次传递可以捕捉到明显的矛盾,比较两个总结,或者根据一个标题评分一个答案. 了解普丁的概述显示了基本模式:生成答案,然后要求模型批评或修改它. 研究给了这个模式一个可信但有限的作用. 任和同事 在 TruthfulQA和TL;DR上重新制定了作为代币级预测的开放自评估,并报告了对其测试的 PaLM 2和 GPT 3设置的更好的选择性生成准确性和更强烈的输出质量相关性. 一项最新的多步骤任务研究发现,逐步自我评估在两个基准数据集中对故障检测的整体分数表现优于,AUC ROC相对增加了15%. 任何结果都不能将模型意见转化为交付收据. 他们表明,自我评估可以在特定任务,提示,模型和数据集下改善决定. 值得信赖的单位是测试的评估器配置,而不是"LLM评判者". 还有已知的故障模式. 据MT Bench和Chatbot Arena报道,强有力的法官在设置中达到超过80%的人类偏好,同时记录了位置,动词性,自我增强和推理偏见. 协议令人鼓舞;偏见清单在运营方面是决定性的. 一个法官可以平均有用, 位置偏差很容易测试. 评价A和B候选人, 换取他们的订单, 没有改变内容, 然后再评价. 王和同事表明,顺序变化可能会显著改变对等排名,并提出平衡位置校准加上人类升级. 如果选择的候选人在交换后发生变化,请记录 unstable . 不要把矛盾当成一个自信的分数. 在校准法官之前,结标准 "质量"太广于校准. 一个承认一个明确的总结的法官可能仍然不值得信赖的事实基础,政策解释,或足够的证据. 定义一个狭窄合同的标准: 校准集需要评估者未撰写的例子,标准所有者给出的标签,以及足够难以揭示滑或过度宽容的评级的负面数据. 将模型识别器,评判提示,标题,示例,输出解析器和门一起结. 任何一个变化都会产生一个新的评估版本. 人类标签不是一个尬的过程;它们定义了目标. 埃瓦尔基因的作者描述"标准漂移":人们在看到实际输出后经常通过标准来精细化他们的意思. 这就是版本标准和标签的理由,而不是隐藏模型分数背后的判断理由. 根据标准至少测量这些特性: 禁止持久的人类标签的协议; 错误通过率,因为一个认可错误输出的评估者会产生错误的成功; unknown 利率,显示缺失覆盖率; 在候选顺序和无关的格式化变化时稳定性; 按语言,任务组,影响类和输出长度的覆盖范围; 其他问题,包括: 不要将无关的标准结合成一个令人放心的平均值. 假设清晰度是100%一致的,基础性是75%的,安全性只有两个标签的例子. 一个88%的混合分数可以隐没有可辩护的安全门. 保持三个行分开. 值是政策选择,而不是论文中的常数. 一个团队可能会接受80%的同意低影响风格建议,并需要确定性证明部署效果. 在释放候选人得分之前,门被结. 再播放校准门 下列装置使用了四个标准和八个路由案例. 它的门是故意简单的:至少有三种人类标记的例子,至少有80%的同意,并且没有在顺序逆转下变得胜利的变化. 决策规则很小: 使用: 这次重播产生了: 两个观测比紧的数字更重要. 首先,该装置包含一个缺失的交付文件,法官称之为 pass . 路由器返回确定性 fail . 它还包含了法官不喜欢的检查数量匹配;路由器返回确定性 pass . 一个模型可以对演示发表评论,但它不能取消关于承诺物体是否存在和匹配的证据. 其次,对式质量在四个标记的例子上达成了完美的协议,但当候选人交换订单时,它改变了获胜者. 门仍然失败了. 历史上的一致不容容容现有矛盾. 这种小重播并不是证据表明80%对您的应用安全. 这是一个可检查的模式来证明每个判决都到达了正确的证据所有者. 直接向最强有力的证据所有者传递现场决定 一旦校准通过,运行时间决定应该保留三条车道. Deterministic lane. 使用文件系统检查,方案验证,测试结果,数据库约束,提供商收据,签名,检查和目的地阅读,当他们可以直接回答问题. 记录观察到的价值和新鲜度. 退出零的命令只证明该命令的合同;单独验证预期的外部结果. 支持法官的路线. 使用固定的评估器来确定清晰度,相关性,音调或规则遵守等标准,当校准覆盖率与当前情况相匹配时. 保留标准,评估者版本,提示哈希,输入参考,判决,解释和校准设置版本. 模型支持判决;周围的政策决定了证据允许的. 人类检查路线. 引发高影响的分歧,新语言,未发现的任务家庭,秩序不稳定,政策例外和不可逆的权威. 包含矛盾的证据和一个具体的问题. "请审查"是弱的路由; "法官说完整,但决定性收据没有出现"是可以采取行动的. 一个 unknown 结果是有用的. 它说,目前系统无法确定该索赔. 转换未知为传递,只能保护仪表板看起来不完整. 不仅仅在日历上进行调整 当模型代号改变,提示被编辑,示例被重新排序,新语言到来,输出变得更长,或者产品开始处理不同的任务家族时,法官可以漂移. 调整这些变化并在计划审查期间监测现场不同意见样本. 保持两个界限的可见性: 1. 自行评估估计有限的质量属性;它不证明可获得性,有用的进步,工具效果,记忆持久性或可交付的存在. 2. 校准评估器可以减少审查负担;它不会获得人类对秘密,支出,发布,删除或其他不可逆转的行为的权威. 结果是AI评估的不太戏剧性的形式. 法官得到了一个有用的工作,确定性证据保持其更强大的工作, Sidewisp 目前处于私密预览阶段。 它正在开发作为现有代理运行时间的健康层,但生产代理健康收集和恢复并未在当前的网站存储库中发送. 如果证据路由问题与您操作代理的方式相匹配,