2026-08-01T09:31:03.171Z

MLflow LLM 评估:添加运行时间健康释放门

复制MLflow的评估路径,然后添加四个运行时间收据,以便通过分数不会成为虚假绿色代理判决.

MLflow LLM评估可以告诉您应用程序的输出是否符合您选择的标准. 它本身不能证明代理人可以到达,按时启动,完成外部副作用,或将承诺的产品留在目的地. 实际情况下,将MLflow评估结果和运行时间健康判决作为两个证据层,然后在发布之前要求两者. 我用MLflow 3.14.0测试了这个边界. 一个基于代码的得分手给了三个代理人一个完美的 exact deliverable/mean 的 1.0 . 只有一个跑步可以通过. 差别不是MLflow的缺陷. 进球者回答的问题和更广泛的操作决定之间存在不一致性. 复制记录的MLflow评估路径 目前的MLflow评估指南由三个组成部分定义评估:数据集,一个或多个得分符和可选的预测函数. 数据集提供输入和预期. 预测函数在尚未存在时产生输出. 评分者将可用的证据转化为反或指标. 这种划分是有用的,因为它使评估问题明确. 如果问题是这个输出是否相当于预期可交付的名称?,一个基于代码的确定性得分器比一个LLM评判器更合适. MLflows 定制得分器文档允许得分者读取 inputs , outputs , expectations ,或一个完整的痕迹,并返回原始结果或更丰富的 Feedback . 实验使用了直线列表,预先生成的输出, 密码流记录了 exact deliverable/mean = 1.0 . 这对定义的证据是正确的结果:每个输出字符串都符合其预期. 结果是可复制的,便宜的,易于解释的. 三种药物运行都是健康的. MLflows 评估数据集的文档将数据集描述为预防回归,版本比较和针对性质量测试的选择例子. 这就是正确的心理模式. 数据集是其示例和得分符中编码的索赔的测试套件;它并不是自动对每个生产故障的统计数据. 将运营收据放在评估结果旁边 同样的装置附加了一个小的运行时间收据每个任务. 它记录了四个事实, heartbeatFresh :运行时间是最近可达的; scheduleOnTime :预期的运行在允许的时间内开始; effectVerified :外部目的地确认预期的副作用; deliverableVerified :承诺的文物存在,并通过了目的地检查. 结果的比较是: 任务 准确的交付 运行时间的证据 释放决定 run 101 通过 所有四个收据都存在 释放 run 102 通过 衰弱的心跳;效果和可交付的情况未经验证 封锁是不可到达的 run 103 通过 时间表错过了允许的窗口 时间很晚. 所有三个评估行都通过了. 只有一个运行可以释放. 在一个工人消失后,一个正确的字符串可以存活在缓存响应中. 经营截止日期后,正确的有效载荷可以到达. 一个工具调用可以返回一个可信的确认,而目的地保持不变. 这些案件中没有一个都无效的结果得分;它们证明了释放决定需要额外的证据. 保持一个稳定的 task id 或 run id 相连的层,但不要将它们分解成一个模糊的分数. 一张紧的唱片可以看起来像这样: 加入关键问题. 没有它,团队可能会将当前的健康证明与另一个版本,环境或重新试验的评估进行比较. 包括应用程序版本,数据集版本,得分版本,环境和观察时间,这些维度可以改变判决. MLflow可以保留评估和追踪证据;运行时间或目的地仍然必须提供只有其知道的事实. 处理缺失证据为 unknown ,而不是 pass . 没有心跳可能意味着收集器失败而不是代理失败. 缺失的目的地收据可能意味着注册失败,验证器失败,或者整合不能揭示这一事实. 这些国家要求进行调查, 用两个门的决定而不是一个混合的分数 一个实际的释放规则是故意无聊的: 每个条款都应该保留自己的证据,新鲜性和失败理由. 这给操作员一个有限的下一步行动: 评估失败将返回提示,模型,工具政策,数据集或得分器. 一个老化的心跳路径到跑步时间或收藏器诊断. 错过到调度器,排队或容量界限的时间表路线. 一个未经验证的效果阻止了重新尝试,直到外部目的地被调整. 输送到生产商或目的地验证商的缺失可达路线. 这种分离也阻止了LLM法官成为它不被设计成的权威机构. 当正确性或质量需要语义评估时,法官是有价值的. MLflow明确支持内置,基于指南,定制和基于代码的得分器. 用这些工具来满足它们的标准. 优先检查文件存在,数据库状态,API资源,测试结果或签署的收据. 不要阅读实验,因为MLflow缺乏生产监测.MLflow文件评估,跟踪,监测,数据集,反和几种得分类型. 较窄的结论是可伪造的:在这里进行的精确评估未能确定四个运营事实,因为其数据和得分者没有测试它们. 当相关证据存在时,您可以添加健康导向得分符,或者当证据在运行时间和外部系统中生活时,将健康分类符放在MLflow旁边. 设备是故意小的. 它不对LLM评审者进行基准评价,在规模上测试MLflow,比较供应商或测量监测覆盖范围. 它的价值是控制不匹配:三个相同的评估通过,三个不同的运行状态,以及一个可检查的规则,解释了释放决定. 对于操作团队的代理人来说,这个界限是有用的:通过最强的适当得分者评估输出质量,在他们的来源上验证操作事实,并在宣布成功之前加入证据. Sidewisp 目前处于私密预览阶段。 它的计划作用是与现有运行时间相结合的健康层,而不是替代MLflow或自动宣称通过评估意味着健康剂. 目前的公共经验是早期访问场所和产品示范;生产监测适配器通常不出货.