2026-08-01T05:02:12.829Z
对于AI代理人的文本工程:审核Manux文本循环
转换Manus文本工程课程为缓存稳定,工具连续性,可恢复的文本,故障证据,进展和结果的收据.
实际答案是 文本工程 AI 经纪人:从建筑手工中学到的经验 没有复制六个快速技巧. 让每个课程成为一个不变的,你可以在跑步过程中检查. 一个稳定的提示前应该有一个版本和哈希. 一个在历史中提到的工具仍然应该有一个可解决的方案. 紧材料应具有可恢复的参考. 目前的目标应有修订和新鲜度限制. 失败的行动应该留下了被删除的证据. 应将重复的操作与输出变化进行比较. 终端报告仍然需要收到结果收据. 这给了你一个环境健康合同. 它可以区分一个有效的运行,一个可恢复的运行,一个取得有用进展的运行, 缓存击中和较低的代币计数有助于, 但没有证据表明代理保留了必要的证据 阅读马努斯的课程,作为有边界的要求. 原始的曼努斯工程职位描述了在构建其代理框架时获得的本地设计选择. 它的作者报告了Manus的平均输入输出代币比率大约为100: 1,并认为,因此,先缓存行为对延迟和成本非常重要. 这篇文章建议: 保持快速预写的稳定性和序列化确定性; 在运行中,掩盖行动,而不是删除工具定义; 将大型文本外部化为可恢复的文件; 重写任务列表,使目标重返最近关注; 保持失败的行动和观察,使模型能够适应; 引入控制的变化,以抵制重复的行为模式. 这些是有用的工程假设,而不是普遍的门. 提供商缓存不同. 一些运行时间可以安全版本历史工具方案. 一个URL可能被保存,但后来无法访问. 的痕迹可能包含秘密. 每八步重复目标是测试值,而不是一般法则. 独立的证据还反对将广告的环境容量视为健康保障. 人类的环境工程指导框架文本作为完整的推理状态系统指令,工具,外部数据和消息历史,并建议保持最小的高信号集,支持所需的行为. 它还描述了正时检索,渐进性披露,紧缩,结构化笔记和多代理分离作为不同成本的不同策略. 控制的Chroma环境腐蚀评估测试了18个模型,而输入长度变化,并报告了不均的降解. 干扰器,语义距离和草堆结构改变了性能. 经营意义是温和的,但很重要的: 你仍然需要证据证明当前的背景支持当前的决定. 构建一个收据,为六种文本突变 捕获和计数器,而不是原始提示. 每个决定点都可以附上有用的收据: 字段对不同的问题提供了答案. 前置稳定性 是一个效率检查. 记录稳定模板版本和内容哈希在可缓存的前置上. 在运行时间允许的情况下,排除随需的时刻标签等挥发性值. 如果有用的输出仍在移动,将运行分类为降解,并调查转换. 工具方案连续性 是决策完整性检查. 保持一个版本的方案登记或从历史工具调用到定义合同的明确翻译. 如果之前的操作中说的是 browser fetch ,但当前的文本不再定义该操作或兼容的版本,则模型可能是基于一个不完整的记录进行推理的. 这应该阻止一个健康的判决. 可恢复的外部环境 是恢复检查. 一个文件路径,对象键,查询或URL只是一个参考. 如果可能,将其与完整性消化,最后一次可访问性检查,范围, 在保存一个验证的引用时,将文件从现场窗口中丢弃是可逆压缩的. 没有可用的参考,就会失去证据. 客观的新鲜性 是一个注意力检查. 任务计划的修订应确定积极的目标,接受的限制,完成的里程碑和下一个决定. 在步骤或时间中测量它的年龄. 不要无休止地添加重复的计划;当工作有意义的变化或它的新鲜度限期到期时,更新一个紧的收据. 失败保留 是学习和审计检查. 计算失败的行为和保存失败记录. 存储错误类,工具,尝试身份,重新尝试决定,以及编辑的消化非任意原始输出. 如果发生了两次失败,但只剩下一个安全记录,以完整的证据来证明后续重新尝试是不能合理的. 反进步重复 是漂移检查. 一次重复行动本身并不是一个循环:页面化,投票和有限的反复尝试可以是合法的. 结合行动签名与输出 delta计,客观的新鲜性,依赖状态和重试预算. 有三次重复的操作可能会有效; 没有特拉状态的三次都值得循环风险判决. 稳定前和控制变化的教训并不矛盾. 保持可缓存的前置和工具合约的确定性. 在此前文之后,应在示例,行动观察或有限的选择政策中应用必要的变化,并测量它是否改变了有用的进展. 应用优先级规则,而不是平均信号 不要把这些字段分解成一个不透明的分数. 低价,稳定的前运行与不可回收的背景不健康. 1. unsafe 未解决的历史工具引用,无法恢复的紧缩证据或失败记录消失; 2. loop risk 目标是陈旧的,并且没有输出变化的操作重复; 3. 未经验证 经纪人报告终端完成,没有有效的结果收据; 4. healthy 每一个文本不变符都通过,并验证具体任务的结果; 5. degraded 文本完整性保持完整,但存在前churn或其他效率故障; 6. WORKING 不变量通过,有用的输出变化,并且运行不是终端. 这种排序故意使完整性失败比效率增长更强. 附带装置每次改变一个条件: 预期结果: 八个案例包括验证的结果,有用的中间进展,前转变,工具方案漂移,不可逆的缩小,删除失败证据,陈旧目标重复,以及报告完成没有收据. 一个结果是故意不方便的: cache churn 案例是 降级 ,不是危险的. 它的前改了,但计划,参考,失败和有用的进步仍然是完整的. 相比之下, irreversible compaction 是 unsafe ,尽管其前是稳定的. 这就是成本问题和证据问题之间的区别. 检查收据,而不是收集对话 收据应透露是否存在证据,而不需要上传证据本身. 对于前,保留一个模板标识符和消化. 对于工具,保留方案版本,行动名称和兼容性结果. 对于外部环境,保留一个范围的参考,消化,字节数量,可访问性结果和新鲜度时间. 如果出现失败,请保留已删除的类和尝试识别符. 为了取得进展,请保留预期的文物的哈希或计数器. 保持提示,响应,凭证,原始工具有效载荷和绝对主机路径在共享远程测量中,除非有单独的明确数据合同要求它们. 在接受合同之前使用三个测试. 首先,运行一个 单变的重播 . 开始从一个已知的设备,只改变一个字段. 判决应该因为你预期的原因而被移动. 如果删除可恢复的引用使国家健康,则规则太弱了. 第二,运行一个 redaction加纳里 . 在失败的有效载荷中放一个合成秘密,通过收据构造器处理它,并声称这个秘密不在错误类和重新尝试的决定中. 保存错误的内容不允许保留敏感内容. 第三,运行一个 结果反示例 . 给分类器提供终端代理消息,同时保留实际可交付的收据. 它必须返回 unverified . 然后添加任务特定的检查文件消化,通过测试,目的地API读取或人类批准,并确认只有此变化允许 healthy . 结果检查必然是具体的工作流程的. 一项研究任务可能需要引用源覆盖和保存报告. 部署任务可能需要实时健康反应和版本平衡. 一个电子邮件任务可能需要阅读目的地邮箱. 没有仅仅是文本的证据表明实现了任意目标. 使用合同作为边界,而不是产品索赔 曼努斯帖子是有价值的,因为它暴露了真正的设计紧张局势:缓存效率与可变的环境,较小的窗户与不可逆转的损失,稳定行为与重复, 行动是使这些紧张局势可检查. 接受合同,当你能回答这些问题,一个真正的运行: 缓存前是否改变了,这是预期的吗? 每个历史工具都能被解释吗? 任何被遗漏的观察都能恢复和检查完整性吗? 目前的目标是否足够新鲜,以便下一步做出决定? 每一次失败的行动都留下了安全的证据吗? 复制行动是否改变任务状态? 什么单独的收据证明了所要求的结果? 如果不清楚任何完整性答案,则保存 unknown 或 unsafe ;不要制造绿色. 如果只有效率降低,而证据和进展仍然稳定, Sidewisp 目前处于私密预览阶段。 它的公共经验是早期访问的网站和互动示范;生产代理健康收集和环境监测通常不发送. 产品的目的是将新鲜性,文本连续性,有用进展和验证结果等证据转化为清晰的健康视图,同时保持不确定性和批准边界的可见性.