2026-08-01T10:18:39.432Z
自我改进的AI代理:促进变化,不要自我编辑直播
结所有拟议的行为变化,将其与其确切的父母进行比较,保护回归预算,并将权威和反弹保持在可写的循环之外.
一个自我改进的AI代理不应该重写其现场行为, 最安全的默认方式是将每一个提议的提示,内存,检索,工具政策或代码更改都视为不可信任的发布候选人. 结候选人,将其与其确切的父母进行比较,以证明它不能编辑,检查所有受保护的指标,证明谁可能批准它, 只有这样,一个可逆的小变化才能进入一个有限的鱼. 这一规则仍然允许改进. 这改变了信任的单位. 反可以自动生成候选人;激活需要证据. 这种区别很重要,因为"自我完善"不仅仅是模范培训. 后续试验不需要体重更新,因此思考会存储口头反在情节记忆中. 自我精炼使用相同的模型交替反和精炼. 路由提示,检索课程,工具允许列表或可编写的脚本可以像一个新的检查点一样改变下一次运行. 你的变化账号必须覆盖这些表面. 在测量之前,冷候选人 首先,我们要考虑两个不可变的身份:积极的父母和候选人. 有用的变化表格记录: 化防止评估和鱼之间进行安静的编辑. 产品的身份防止针对 agent v41 生成的候选人被提升到现已活跃的 agent v42 . 这里有可编写的表面列表显示了真正的爆炸半径. 作为"记忆课"的建议并不小,如果其过程也可以编辑评价者或权威政策. 不要让候选人写出其拒绝申请案例,得分代码,录取门,批准政策或退出历史记录. 这些是控制器,锁和紧急出口. 一个能改变它们的代理人可以提高其分数,而不改善任务. 这也是为什么只需添加的学习文件应该进行版本化. 一个简短的课程可以在每次后续运行中重新引导检索,抑制升级或偏见工具选择. 只有记忆变化描述了存储机制,而不是操作风险. 根据锁定证据,对照父母和候选人的确切身份 绝对的候选人分数是弱的证据. 运行父母和候选人与相同的案例ID,环境版本,工具设置,随机性政策和结果验证器. 存储相对结果. 问题不是候选人得分为0.86吗? 问题是与父母相比发生了什么变化? 开放AI自行进化的代理厨师显示了一个实用循环,其中包括基线,人类或模型反,评估,分数门,重试限制和更新的基线. 这是一个有用的机器来生成和测量候选人. 一项生产推广决定需要一个比一个总值更严格的边界,因为平均水平隐藏了哪些财产支付了收益. 假设任务成功从 0.80 升至 0.89 ,而工具效果完整性则从 0.99 降至 0.96 . 平均水平可能会上升. 如果重复或缺失的外部影响是不可接受的,则改变仍然失败. 具体说明目标指标和保护指标: 计量 方向 促销规则 任务的成功 较高 候选人必须提高至少 0.03 工具效果完整性 较高 不允许回归 批准路由 较高 逆转不得超过 0.02 每个验证结果的成本 下面 增加不得超过 0.05 使用与可观测结果相关的指标. 一个从零出发的命令并不是证明可交付的存在的证据. 一个追踪工具的呼叫并不是证据表明目的地确切改变了一次. 模型法官可以帮助主观质量,但它不应该取代确定性文件,数据库,许可或效果检查. 锁定套件应包括已知故障和有效等待. 否则,代理可能会通过变得更加激进来变得更好: 减少升级,减少问题,更快完成, 包含至少一个候选人不直接优化的范围外措施. 独立的提议权和激活权 让代理人提出改变并不意味着有权激活它. 根据表面和爆炸半径定义批准. 在预先批准的政策下,一个小的快速路由变化可能会进入20个任务的鱼. 检索政策或工具政策的变化可能需要一个命名的人. 运行时间代码,评价者逻辑,凭证范围和不可逆转的行动应不受自动推广的影响. 对于高影响的行动,OWASP的过度机构指导建议提供最低许可,下游授权和人类批准. 适用于自我修改的分离. 改进过程只能获得写作候选文物所需的能力. 一个不同的,较小的组成部分拥有评估和推广. 有效的权威收据包括: 在实践中将收据扩展到候选人消化器. 结束时间. 不要接受 代理可能会改进自己作为可执行的许可;它缺乏表面,界限和时间界限. 等待获得批准并不是失败. 如果证据通过,但变化表面需要一个人,请返回 AWAITING APPROVAL ,含有候选消化,测量的海,要求的表面,反弹目标和拟议的鱼大小. 运行是健康的,当等待有主人和可重新决定. 按一下运行门. 秩序使得结果可以解释. 在讨论得分之前拒绝结构问题: 1. I身份: 消化是有效的,候选人的父母仍然活跃. 2. 受保护表面: 候选人不能写测试,保留数据,权威,反弹历史记录或其他被禁止的表面. 3. 结合证据: 的父母和候选人使用了相同的锁定证据集. 4. 退回预算: 每个受保护的指标都保持在自己的范围内. 5. Rollback: 已命名的前版本仍在解决. 6. 材料获益: 目标改进清除了预告的地板. 7. A权威: 收据符合表面和鱼限制. 第五门保护安全性和可审核性. 材料增长防止缩:产生噪音的变化,但不应该进行任何有用的改进,而不仅仅是因为它通过了安全检查. 监管局决定可鱼准备和人类审查. 伴侣装置在没有模特调用的情况下实现了这一优先级. 运行它从文章文物目录中: 八位候选人有意分享一个可信的成功故事:大多数人提高目标分数. 他们的决定不同: 候选人 决策 具有决定性的证据 安全提示补丁 CANARY READY 配对收益,没有保护回归,有限制的汽车权限 检索变化 AWAITING APPROVAL 证据通过;表面需要一个人 简单的记忆课 HOLD NO MATERIAL GAIN 安全,但目标获利只有 0.01 已停产的父母 BLOCKED IDENTITY 候选人来自错误的活性基线 评价者作者 BLOCKED PROTECTED SURFACE 候选人可以更换统治者 新的私人案件 BLOCKED EVIDENCE 申请人没有使用锁定套件 总赢家 BLOCKED REGRESSION 工具效果完整性下降了 0.03 遗失的旧版本 BLOCKED ROLLBACK 已命名的反弹器件不可使用 有效的结果不是复合的安全分数. 它是一个状态和一个修复界限. 一个过时的父母需要再生. 保护回归需要诊断. 一个失踪的反弹目标需要修复文物. 平均这些失败将隐藏所有权. 加拿大改变,而不是你的信心 通过离线门将使候选人有资格获得鱼; 限制任务,时间,支出,工具和副作用. 让家长随时来. 运行鱼只能独立验证结果. 与当前或最近的原始基线进行比较,如果工作负载允许. 在激活之前定义反弹触发因素:保护测量漏洞,未知的结果率,重复效果,缺失批准,支出上限或证明新鲜度故障. 翻转意味着恢复原始产品,并验证预期任务结果是否返回. 一个完成的反弹命令是活动,而不是恢复. 在鱼之后保存了三个记录: 不变的候选人和母体消化器; 无线和加拿大证据,包括不可使用的信号; 提升,暂停,批准或撤回决定,并收到其授权的通知. 如果证据消失,请返回 UNCERTAIN ,停止晋升. 不要将缺失的指标转换为健康的值. 如果同样的提案一再失败, 顶试图再转向一个人, 而不是让改进循环消耗无限的时间和代币. 知道这门不能证明什么 提供的审计验证了表现的形状,优先级,对称的地图,权限范围和反转分辨率. 这并不是证明你的停留代表生产, 人类的标题是正确的, 测试可能会变得过时. 评估人员可以分享模型的盲点. 申请人通过后,外部工具可能会发生变化. 因此,实际的默认限制:自由自动化候选人生成,仔细自动化低风险评估,并且只在明确的权威范围内自动化激活. 保持高冲击和不可逆转的表面的人类批准. 推广后继续监测,因为自进剂只有当其有用结果保持健康时才健康而不是当其更新管道繁忙时. Sidewisp 目前处于私密预览阶段。 它的方向是在现有的代理运行时间周围添加一个健康层,具有证据,批准边界和结果验证;生产监测适配器和恢复系统通常不出货. 如果这个边界与你操作代理的方式相匹配,你可以加入私人预览.