2026-08-01T11:10:50.742Z

对于AI代理的科学可靠性:审核证据

报纸的12个指标变成可检查的证据配置文件,然后添加现场健康收据,

简短的操作读取 向科学AI代理可靠性 是这样的:保持纸的四维形状,但永远不要接受没有产生它们的证据的12个分数的排行. 对于部署决定,还要添加可达性的当前证据,预期运行,拥有等待,工具效果和目的地结果. 一个基准资料和一个实时的健康判决答案, 斯蒂芬·拉班塞及其同事的2026年6月 arXiv v3论文测量了可靠性, 它评估了15个基于GAIA的模型和一个清洁的 τ 子组,然后将可靠性分解为一致性,强度,可预测性和安全性. 作者的结果是故意不方便的:在研究的释放窗口上,能力增加并没有自动产生可靠性增长. 这对于运营商来说是有用的,但只有在将每个指标转化为证据合同后. 下面的检查列表完成了这种翻译,并明确了剩余的生产界限. 阅读12个指标作为证据要求 论文第2表包含12个指标. 这不是12个可替换的质量点. 尺寸 纸质指标 保存的最低证据 连贯性 结果;轨迹分布;轨迹序列;资源使用 任务集版本,独立运行数量,结果预言,行动序列,资源单元,每次运行记录 强度 错误;环境;快速 基线试验,对 perturbed 试验,版本 perturbation 规范,以及证明环境或快速变化保留了任务的意义 预测性 校准;歧视/AUROC;Brier 在分类之前所获得的信心,二元结果证据,结或排名方法,样本数量和信任来源 安全性 合规性;损害严重性 版制约,每个违规行为,严格规则,法官身份和版本,以及人类验证样本 因此,第一个操作规则很简单:没有命名符,协议和证据位置的 a指标不可用,不低,不健康 . 考虑结果一致性. 五次重复四十项任务,会给出200个试验,但仅仅一个分数不能告诉你是否相同的任务在成功和失败之间交替, 这些模式的平均准确性和操作后果可能非常不同. 论文的指标是为了揭示这一区别; 抛弃试验级证据将重塑它解决的问题. 强度指标需要更大的注意力. 缺陷注射分数仅可解释与基线相比. 快速强度分数只有在变体保持语义相等的情况下才有效. 改名一个JSON字段可以测试环境脆弱性;删除解决任务所需的信息改变任务. 在结果旁边存储扰动发电器,它的版本和经过审查的样本. 预测性需要同样严格的时间表. 在测试结果前获得信心. 经纪人看到测试结果后的信任不是预测. 记录是否来自代理,单独的模型,校准分类器或学. 校准,AUROC和Brier分数都可以从错误的信任信号中正确计算. 最后,保持纸张的安全边界. 其公共方法报告安全性与总可靠性分别. 这就是对操作的默认标准. 一个强的一致性得分不能平均一项未经授权的破坏性行动. 合规措施是多少次遵守限制;条件损害严重程度问违规行为严重程度. 你需要频率和尾巴. 在讨论门之前,请对个人资料进行调整 如果证据包是不完整的,则门论是过早的. 我建造了一个小的幕,首先检查结构: 所有12个命名的指标都存在; 每个指标都有分数,数值器,命名器,协议和证据URI; 强度结果包括对对基线和扰乱数量以及版本规格; 可预测性结果确定了信任来源; 安全结果确定限制和判断方法; 安全性并非被整体可靠性总体中折叠; 自动部署包括未空的人类验证的安全样本. 然后检查了六个类型的现实健康证据:新鲜性,可访问性,时间表覆盖性,等待所有权,工具效果收据和目的地结果收据. 包含的说明资料包含了所有12个纸质指标和30例的人类安全审查. 结果仍然是: 两个阻塞器缺失了工具效果和目的地结果收据. 后面测试提供了这两个证据引用,并将结果更改为 PASS . 这并不证明虚构的代理是安全的; 它证明证据表足够完整, 区别是重要的. 通过: 这是一件故意的小品. 它证实存在和形状,而不是科学有效性. 它不能决定一个基准指标是否代表您的用户,信任报告是否诚实,两个提示是否意味着相同的事情,或者一个LLM法官是否正确评分损害. 这些仍然是域审查任务. 不要将个人资料转换为一个发布号码 论文计算了尺寸总体来支持比较,但其自己的选择揭示了为什么运营商应该让个人资料可见. 整体可靠性总体结合一致性,可预测性和强度;安全性仍然是独立的. 该论文还指出了重要的限制:两个基准仅涵盖一个狭窄的任务部分,每一个基准使用一个架子,安全评估取决于LLM评审员,测量和集成选择是主观的,并且零温度可能会超估在选择以最大限度地准确的设置下可用的可靠性. 这些限制应出现在部署决定旁边,而不是在存档的方法说明中. 实际审查可以采用三个层次: 1. 个人资料完整性: 这12个指标是否得到可检查证据的支持? 2. 申请门: 对于此任务和权威水平,哪些尺寸和尾部条件是可接受的? 3. O运行证据: 当前部署的系统是否可达成,进步,局限并产生预期的外部结果? 第二层必然是具体的应用. 一个具有强制性的人体审查的稿件写作助理可以容忍与一个没有监督的退款代理不同不一致. 这篇论文也提出了同样的总体观点:可靠性要求应随着自主性扩展. 避免将排名表的分数复制成通用发布门. 对于后果副作用,在平均之前使用否决权. 一个合理的地方政策是: 这种排序使得吸引人的平均值不隐藏未知的或严重的状态. 添加生产证据,该文件不声称测量 一个基准标准根据定义的协议评估行为. 运营商也必须知道现在发生了什么事. 添加这些六份收据,而不假装它们是额外的纸质指标: 证据的新鲜性: 每个健康信号最后一次检查的时间和其过期. 可访问性: 运行时间和所需的工具是否可以现在联系. 时间表覆盖范围: 预期的运行开始,完成,重叠或错过. 等待所有权: 是否有合法依赖性拥有所有权,截止日期和可重置状态. 工具效果调整: 是否已过期或重新尝试的操作改变了目的地零,一次或多次. 目的地结果验证: 承诺文件,数据库更改,消息,测试结果或其他可交付的文件是否存在并符合其接受规则. 这项附加条避免了两类错误. 首先,重复的基准测试成功并不证明目前生产运行时间是可达的. 其次,成功的命令或模型响应并不证明外部效应或可交付的存在. 项目网站链接的哈尔带存储库在这里有帮助,因为它强调可复制的评估,跟踪,隔离和成本跟踪. 这些是强大的评估输入. 当代理人在基准之外行动时,他们仍然需要部署特定的结果预言和当前的运营收据. 用这张纸作为一个个人资料,而不是一个许可证. 首先要从一个工作流程开始,而不是整个机队: 1. 固定运行时间,模型,架架构提交,工具版本,任务集版本和评估日期. 2. 运行重复的名义试验并保留结果,轨迹和资源记录. 3. 在检查结果之前,确定错误,环境和迅速的扰乱. 4. 在评级之前,就能获得信心. 5. 定义限制和严重程度;人验证安全样本. 6. 保持安全与聚合物分开. 7. 附上六个实体健康证据课程. 8. 记录 unknown 在任何缺少证据的地方. 9. 设定对此工作流程的权威和后果的门和否决权. 10. 在材料模型,提示,架子,工具或环境变化后重新运行配置文件. 这使得论文的主要贡献保持:可靠性是一种形状,而不是准确性的同义词. 它也阻止这种形状成为装饰仪表板. 审查的可观察结果不是 可靠性分数被计算出来. 这是一个版本的决定,有可检查的证据,明确的未知,以及在权威扩大之前必须验证的清单. Sidewisp的目的地是该边界的运营侧面:可访问性,有用的进展,背景,工具,结果和其他地方已经运行的代理人的成本. Sidewisp 目前处于私密预览阶段。 它的生产监测适配器和恢复系统通常不出货,因此本文描述了一个操作方法,而不是目前自动化的Sidewisp功能. 如果这些证据与你需要捕获的故障相匹配,你可以从Sidewisp网站加入私人预览. 来源 拉班塞等, 向AI代理可靠性的科学, arXiv v3, 2026年6月 整体剂排行榜可靠性方法 HAL可复制的评估带 ICML 2026海报页面 开放查看记录