2026-08-01T08:39:07.442Z

在它到达代理之前,关闭每一个RL更新

转化 Agent Lightning 的发射,跨度,奖励,加拿大结果,批准和反弹为每一个训练有素的资源的证据支持的门口.

论文 代理闪电:训练任何AI代理人使用强化学习 回答了一个重要的工程问题:一个现有代理如何在没有重建RL循环的情况下生成训练数据? 它没有回答下面的问题:一个新训练的资源应该被允许什么时候影响一个真正的工作流程? 安全的默认是保持每一个新模型或提示资源作为一个候选人. 仅仅在您可以加入更新后, 更新到其确切的父母, 数据快照, 评价者, 推出尝试, 追踪覆盖, 保护的案例, 限制的加拿大病毒结果, 批准和测试的反弹. 更多的奖励是有用的证据, 这一边界更符合框架,而不是反对它. 雷已经将代理执行与学习算法分开了. 保持这种分离作为一个释放门. 雷代理记录了什么,这些记录证明了什么? 纸将特工闪电作为一种方法来脱离特工执行与RL训练. 它将代理执行模型作为一个马科夫决策过程,通过信用分配模块将代理轨迹转换为培训过渡,并报告了对文本到SQL,检索增强生成和数学工具的实验. 目前的项目文件给运营商更具体的名词: 一个 Resource 是算法可能更新的资产,例如模型或提示模板; 一个 Rollout 是对资源进行的工作单位; 一个 Attempt 是该部署的执行一次,包括重试; 一个 Span 记录事件或执行后的痕迹; 一个 Reward 是一个数值判断,附加于某个推广期; LightningStore 将执行代理的运行器连接到使用证据和更新资源的算法. 这是一个强大的训练界面. 这不是一个完整的释放收据. 想象一下最终成功的部署,需要四次尝试. 最后的回报可能会看起来很好,而重新尝试则会显示出不确定性,成本债务,或不定期失败的依赖性. 另一次推出可能会带来很高的回报, 第三个可能会改善平均评估分数,同时打破防止破坏性工具调用的唯一受保护的案例. 这些都是不同的失败: 记录 答案有用的问题 问题,它不单独回答 部署 试图做什么任务? 预期的外部结果是否存在? 尝试 杀戮事件发生了多少次? 最后的成功是稳定的还是只是幸运的? 跨度 如何观察到这些事件? 没有工具的重要效果是正确的吗? 奖励 一位名为法官如何评分某些行为? 保护行为,隐私和反转是否保持完整? 资源更新 什么样式或提示出现了? 这种资源应该是默认的吗? 这种区别很重要,因为官方架构允许算法从跨度中学习和更新资源,而不是运行者成为部署权威. 这是一个特征. 不要把最新资源作为被批准的资源来删除. 在培训更新周围放一个收据 使用单个不可变的更新收据,组装成三个阶段. 这份收据可以存留在雷电代理外,只要它存储稳定的标识符, 在培训之前:结身份和权威 记录候选人资源ID,其准确的母资源ID,培训数据快照,已保留的数据快照,评估器版本,算法配置,代码修改和预期范围. 说明哪个参与者可以批准鱼,哪个参与者可以将资源作为默认. 父母必须选择一个你仍然可以装载的文物. 由于最新更新不是一个反弹目标,因为自编写指令以来,持续学习已经产生了三种新资源. 保持评价者,保护案例,晋升政策和回归历史在学习者可写的表面之外. 否则优化器可以通过更改规则而不是行为来提高其明显的分数. 在培训期间:试图和证据的报道 在受理培训和验证窗口中的每次部署,保留: 具体的跨度家庭取决于工作流程. 不变量比名称更重要:在查看结果之前,声明应该存在哪些证据,然后报告缺失的证据是不可用的. 不要把缺席变成一个健康的价值. 试图得到自己的反击. 一次完成的尝试和14次沉默失败的推出并非相当于一次完成的推出. 在培训前决定重新尝试预算,区分预期的重新样本与基础设施重新尝试,并保留每个尝试的原因. 经过培训:学习成功与入学分开 首先比较候选人和父母在锁定禁区. 报告总体结果,同时为受保护案例家庭设定零容忍或限额预算. 然后将候选人运行在一个不能超过一个明确的任务,时间,工具,成本和副作用的边界. 鱼收票应该验证目的地,而不仅仅是指令. 如果代理人应该创建一个文件, 查询预期的路径并验证其内容. 如果它应该更新一张门票,请重新阅读门票. 如果不能通过确定性检查效果,请记录较弱的法官或人类证据及其不确定性. 最后,测试回滚. 在同一边界环境中加载正确的父母,并证明路由可以返回它. 只有授权的人类或政策限制的释放行为者才能批准下一步. 一个4个候选人的实验 我将门编码为一个确定性 Node.js 装置. 每个候选人都会提高得分. 它们仅在运营证据上不同: 该装置评估了七项检查: 1. 资源,主体,数据集快照和评估器被固定; 2. 每个完成的部署都具有完整的预期跨度覆盖范围; 3. 意想不到的重试债务为零; 4. 候选人在锁定的门上击败了其确切的父母; 5. 没有受保护案件退回; 6. 每个限制式加拿大鱼任务都具有验证结果,没有记录的有害影响; 7. 后者被测试,一个授权的演员批准了这一步骤. 它的输出是故意不方便的: 最大的奖励损失. 候选C提高0.10,但破了三个受保护的案例. 候选B0.08升级,但在120次和14次意外重试中,只有83次全面推出. 候选人D改善了0.07%,但只检查了20个瘤结果中的18个,无法解决或测试其父母. 候选人A通过了所有七项检查,但他的判决是故意的 PROMOTE TO BOUNDED CANARY ,而不是safe或部署到处. 可执行的文物及其机器可读的输出使得论文可伪造. 改变一个字段,再运行,检查失败的检查. 这项政策的设计严格,但其门可用于真正的工作流程,而不是隐藏在散文中. 持续学习需要新鲜的规则 机器人雷的文档还描述了在线或连续学习模式. 运行者可以机会性地报告部署和跨度;算法对新证据进行民意调查,并在足够的数据到达时可能更新资源. 这环节使得新鲜感成为正确性的一部分. 一个表示"候选人改进了"的仪表板, 没有命名数据截止,评估版本,资源母和加拿大窗口, 呈现出无法重建的结论. 使用两个提示: 当算法创建更新时, latest candidate resource 可能会提升; 在完整的更新收据通过后, approved default resource 才会推进. 永远不要把他们称为别名. 要求批准违约的消费者不应该默默地接待最新的候选人. 也定义一个陈旧的证据规则. 如果在门运行后,评估器,工具合同,任务分配或父母改变,则无效取消所影响的检查. 一个以前的加拿大鱼不会自动覆盖一个新的许可,目的地,模型服务器或重试政策. 在长期训练中,停止条件是奖励条件之外的. 当跨度覆盖率下降,债务再次跨越其边界,受保护的集体退缩,父母无法使用,或鱼无法验证外部影响时,暂停. 教练仍然活跃描述活动,而不是有用的进步. 尊重项目的确定的边界 该项目的承诺支持的负责AI的文件描述 Agent Lightning为研究型,要求在商业或现实世界中使用之前进行进一步测试,并建议避免高风险决策环境. 它还将下游的准确性,安全性,公平性,隐私,数据集权利和人类监督留给采用者. 一个更新网关支持这一责任,它不会放弃它. 该装置不能证明无限安全性,检测每一个分布转移,或者使一个小的英语语言的加拿大代表另一个语言或受监管的域. 它的有用承诺更为狭窄:奖励积极但缺乏证据的更新仍然被隔离. 结果的操作规则很简单:让雷电机优化候选人,但让推广做出单独的,有证据的,可逆的决定. 保持运行者算法界限可见,保存确切的父母,在训练前声明预期证据,验证真正的鱼结果,并在改变默认之前要求授权. Sidewisp 目前处于私密预览阶段。 它的产品方向是代理健康可达性,有用的进展,工具的访问,结果,成本,证据和安全的批准界限但生产代理闪电监测并不是作为运输集成.