2026-08-01T15:00:30.187Z

AI代理测试框架:根据证据选择,而不是特征计算

一个可运行的四门选择器将重播,工具效果,内存和结果证据进行比较,然后将每个仍然需要的建议暴露在适配器上.

一个 AI试剂测试框架 应根据它可以复制和验证的证据而不是其目录中的指标数量来选择. 对于一个充满状态的,使用工具的代理,当一次性环境,外部代理执行和代码得分器成为中心时,合理的第一个原型是检查AI. 在模拟用户和多轮操作行为占主导地位时,LangWatch场景是更好的原型. MLflow适合那些评估数据集和实验历史已经是组织层的团队;DeepEval适合一个以 pytest为中心的回归工作流. 这是一个原型的顺序,而不是一个普遍的排名表. 任何一个框架都不知道 你的 账单是否创建一次, 你的 内存是否幸存于重启, 这些是应用预言. 选择过程只有当它列出在收养之前剩下的工作时才是诚实的. 首先要从框架必须留下的证据开始. 代理测试不是扩大即时测试. 一个代理在几个转折中改变状态,跨越权限界限,调用工具,等待,重新尝试,并可能完成外部文物. 一个流动的最终反应是几个观察中的一个. 人类公司的代理评估指南分开任务,试验,转录,结果,评估带和评分器. 它还区分了基于代码,基于模型和人类的分类. 这种分解给我们带来了一个有用的选择问题: 每个决定性事实将来自哪里? 使用四个门: 门口 需要证据 常见的假替代品 再播放 同一个装置可以恢复相关输入,工具状态,权限和启动数据 再发送相同的提示 工具效果 目的地证明预期的效果发生了正确的身份和数量 一个痕迹显示,工具叫 记忆连续性 需要做出的决定会超越你真正害怕的边界:重新启动,压缩或移动 谈话有几个方向. 结果验证 一项确定性检查证明所承诺的文物或状态存在,并且是有效的 经纪人说,它已经结束了. 一个框架可能会暴露所有四个问题,而不需要实现你的四个证据. 这是可以接受的. 坏结果是隐藏一个定制数据库查询,重新启动器件或文物验证器在模糊的标签下. 区别最重要的是两个边界. 目的地发生变化后,工具调用可以停机,因此运输成功和效果成功可能不一致. 一次多轮测试可以在一个过程中保持状态,而部署的代理在重新启动后失去相同的决定. 如果一个框架比较崩了任何一对,它的分数对代理的可靠性没有用. 现在的四个框架,通过这些门来阅读 我在2026年7月27日查看了目前的官方文件, 下面的"习惯"水平并不是批评;这意味着框架提供了扩展点,而应用必须提供真相. I查看AI 文档组合数据集,代理,工具和得分符,外部代理执行,评估日志和几个沙盒后台. 它的官方概述甚至使用一个代理通过工具在Docker沙箱内操作. 这使得它成为可执行,有状态的任务的强大的起点. 一个定制得分手可以检查结果的环境. 它仍然需要连接到真正的目的地和故意构建的重启记忆神器. LangWatch场景 从一个静态输出输入行而不是多转的模拟开始. 它的代理模拟文档显示了中间工具调用预期,如创建的门票,错误恢复测试和生产中发现的问题的复制. 这种形状是吸引人的支持,声音和其他互动代理. 记录的对话状态并不是证明决定幸存于流程死亡的证据, MLflow 组织围绕数据集,预测功能,得分,运行结果,人类反和监测的评估. 采用目前的GenAI评估概述使定制得分成为评估运行的一流组成部分. 这很有用,当团队已经将数据集和实验谱系作为其真相来源时. 选择成本是预测功能周围的状态杆:恢复工具世界,强制重新启动,并调整外部效应. 在Pytest形状的工作流程中, DeepEval 提供本地测试运行,单轮和多轮情况,门值,追踪和回归比较. 它的快速启动对于需要评估的团队来说, 快速启动依赖于基于模型的指标,因此运用合适性证明应该增加确定性效果和结果检查,而不是假设法官评分证明目的地状态. 框架 记录的重力中心 首先要做一个原型, 显而易见的适配器进行测试 检查AI 可执行的代理任务,工具,沙盒,得分手 代理改变文件或其他可检查状态 实际目的地效果;重启内存 长视场景 多轮模拟和步骤断言 用户行为和恢复路径导致故障 实际目的地效果;重启内存 流量 数据集,得分,运行历史,反 评估生命周期和血统已经在MLflow中存在 状态固定;效果;重启内存 深入的价值 皮塔斯式的测量回归和追踪 团队需要一个轻量级的试验室入口点 状态固定;效果;重启内存;确定性结果 这张表是故意比较产品较窄的. 它没有说任何关于托管的价格,支持,维护人员的响应能力, 它回答了一个问题:哪个记录的执行表面最接近这个代理所需的证据? 运行选择器,然后不信任得分 附带的 framework evidence.json 记录了每个候选人的4个证据水平. 0 意味着没有保留的原始源证据, 1 意味着需要明确的定制适配器或分数器, 2 意味着文档呈现出一流的工作流程. 在 2 上重复状态工具场景,在 4 上重复工具效果,在 4 上保持存储连续性,并在 5 上验证结果. 运行文物: 产量的决定性部分是: 检查和LangWatch场景均获得权重证据分数为 22 . 检查仅因为声明的工作负载是 stateful tool , 转换工作负载为多轮模拟,顺序应该改变. 改变重量,结果可能会改变. 这种敏感性是个特征:它使得团队的假设可以进行审查. 记得永远不能消除空白. 这样一来,如果说没有适配器工作,那么结果就不那么可信,也不那么可信. 矩阵不能知道目的地的方案,一个效果的身份规则,记忆必须保留的决定,或者可交付的有效性规则. 这件文物也有严格的局限性:它是已有日期的文档审计. 它不安装所有四个框架,也不测量集成时间. 用它来选择实验的顺序,然后让两个不方便的案例决定. 通过两种不同的方式使合适性证明失败 第一个案例测试了模糊的工具效果. 设置一个目的地设置,其中工具将一个对象提交,然后运输将返回时间. 带只能通过: 1. 保持在重试边界的稳定操作身份; 2. 检查目的地,而不是信任呼叫结果; 3. 将国家归类为已有承诺,而不是盲目重新尝试; 4. 在运行记录中显示了开发人员可以调试的证据. 第二个案例测试重新启动连续性. 让代理人选择一个有限的计划, 坚持只允许的决定状态, 带只能通过: 1. 证明重新启动发生; 2. 恢复相同的装置,而不泄露隐藏响应状态; 3. 验证所需的决定是否存活下来; 4. 检测过时,缺失或矛盾的记忆; 5. 独立验证最终文物. 如果代理人要求批准,请包括合法的等待作为控制. 一个标记每次停顿作为失败的试验带将压力产品去除安全权限界限. 证据应该区分工作,等待,停留和完成,而不是奖励不间断的活动. 时间盒原型. 一个小团队不应该在复制这两个故障之前构建一个通用适配器层. 给每个候选人相同的设备,相同的结果预言,和相同的调试预算. 优先考虑使证据链最短,最可检查的框架,即使另一个候选人产生了更多的综合指标. 框架X是最好的. 框架X是通过这些命名的适配器达到我们的两个硬验证,而框架Y不是相同的预算. 检测证据不是现实代理健康 发布前评估是否能够处理已知任务和控制故障的构建. 现场健康问,目前是否可以达到特定部署的代理,取得有用的进展,保持所需的背景,达到其工具,产生预期的结果,并在合理的时间和成本范围内保持. 通过评估并不能证明昨晚被开放的时间表, 在现有运行时间周围的健康层是Sidewisp的目的地:区分工作与等待或扎,展示证据和新鲜性,并在解决问题之前验证结果. Sidewisp 目前处于私密预览阶段。 公共体验是早期访问的网站和互动示范;生产代理健康收集,运行时间适配器和自动恢复通常不出货. 所以要明确界限. 使用所选的测试框架,在释放前可见控制回归. 使用运行时间特定的证据和独立的结果检查,以确定释放后的活体健康状况. 绿色测试是有价值的证据,