2026-08-01T20:42:41.705Z
AI 剂可观察性:测试决定复杂性经过缩
可复制的前/后压缩测试,以将保存的决定和批准的变化与丢弃,冲突和未经验证的代理环境分开.
文本紧缩应被视为可观测的连续性界限,而不是一个常规的活动. 实际情况下, AI代理可观测性 的默认标准是,在压缩之前,捕获一组小任务决策,在代理恢复后进行比较,并且如果决定消失,未经授权更改或缺乏新证据,则保持运行不健康或不确定. 不变的集合不需要谈话. 对于后续工作,它可以包含三到七个标识符,如 scope , approval boundary , target 和 acceptance test ,加上消化,修订,观察时间和批准参考. 一个相匹配的消化意味着决定幸存下来. 改变消化才是健康的,只有当人类明确批准的过渡将旧和新价值观联系在一起. 这种额外的测试缩小了活动远程测量所留下的差距. 一个代理可以发出一个复合后的事件,重新加载项目说明,成功调用工具,并且在默默地向错误的分支工作,跳过所需的批准,或使用过时的定义做了. 遵守边界,而不是称之为健康. 不同的运行时间会以不同的方式暴露压缩. 克劳德代码是一个有用的具体例子,因为其当前的文本窗口文档指出, /compact 将对话取代为结构化的摘要. 启动环境通常重新充电,而字面交谈,完整的工具输出和中间推理不再存在. 同样的文件还描述了技能重新注射的预算限制和例外. 它的子参考暴露了几个相关的生命周期信号: 在手动或自动压缩之前, PreCompact 燃烧; 紧缩完成后, PostCompact 燃烧; 报表 SessionStart 可以报表 source: "compact" ; 报道 InstructionsLoaded 可以报道 reason: "compact" . 这些事件表明,一个边界发生, 他们不能证明,紧密的总结保留了每一个任务决定. InstructionsLoaded 还回答了一个更狭窄的问题:一个指令源进入了文本. 这并不能证明代理人正确解释它,也不能证明40轮前的任务特定选择存在于该文件中. 长期的指示与当前的决定之间的区别很重要. 克劳德代码的记忆文件描述了 CLAUDE.md 和自动内存作为持续的文本,同时明确指出它们是文本而不是强制配置. 项目会议属于那里. 一个临时分支选择,一个运行许可限制,或者为当前任务进行谈判的接受测试属于单独的任务记录. 不要仅仅因为发生了自动缩而警报. 紧缩是正常的环境管理. 警报,当其两侧的证据不一致,或者当经过缩后的观察从未到达了运行时间特定的窗口时. 定义决策不变,而不是转录档案 一个连续性记录应足够小,可以审查,并且足够安全,可以保留. 这个例子存储了消化而不是原始决策值: 这些名字是故意的: scope 标识在边界内的存储库,服务,数据集或目的地; approval boundary 记录哪些行动仍然需要人力权威; target 可以识别预期的分支,环境,发行或文物; acceptance test 确定解决任务的确定性检查; 简介: constraint 涵盖一个具体任务的禁令,该禁令必须存活在总结中. 在消化之前将决定正常化. 排序对象键,使用一个字符编码,将 null 与缺失的字段区分开来,并版本正常化器. 否则,无害的格式变化看起来像漂移. 保持在谈话的总结之外的预编程快照;只需一个本地添加文件或任务数据库就足够了. 简单的哈希不是加密. 一个可预测的秘密或两个价值的政策的消化可以通过数值来猜测. 永远不要把秘密,提示,答案,原始工具的有效载荷, 对于敏感低值,存储一个不透明的标识符或使用在代理环境之外的键式HMAC. 一个批准的变化不仅需要一个新的消化: 这一记录区分了合理的调整与决定的推移. 监视器不应该拒绝每一个变化;它应该拒绝未解释的变化. 复制六次连续性测试 我用六种合成缩界限来测试一个只发生事件的规则, 每个案例都包含一个完整的事件前/事件后的对,所以只有事件规则标记了所有六个健康. 最强的规则是将每项预压缩决定与其后压缩决定进行比较: 运行保留的文物从其目录中: 结果是: 两起案件都保留了三项决定. 一个通过人类的明确批准改变了接受性测试. 其他三者失去了批准界限,没有授权改变范围,或者没有新的观察时间重复测试消化. 这一结果并不能估计普遍的失败率. 设备是边界测试,而不是生产遥测. 它的可伪造的索赔更窄:观察到的紧缩对不能区分这些六个状态,而不变的比较可以. 五个州通往不同的行动 国家应该确定最小安全反应. 国家 含义 默认行动 preserved 每个要求的决定都与新的证据相匹配 继续保留收据 approved change 通过明确授权过渡改变的决定 继续新的审查和审计链接 dropped 压缩后缺失所需的决定 暂停后续工作,恢复或要求缺失的决定 conflicting 没有相应的批准的变化 在下一个可逆的边界停下来,问一个人 unverified 价值存在,但缺乏新鲜性或来源证据 再观察;不要从模型散文中推断健康 当多个缺陷发生在一起时,优先事项是重要的. 缺失的批准界限应超过过时的接受测试观察,因为它改变了代理所允许的操作. 即使工具活动和测试看起来很健康, 范围冲突应该停止写作. 相比之下,批准的变化不仅仅是因为哈希不同. 保持活动和连续性作为健康的分别维度. 一个运行可以同时是 working 和 conflicting :有用的输出正在移动,但朝着未经授权的目标. 也可能是 waiting human 和 preserved :所有决定都存活下来,但下一步的行动仍然需要批准. 将这些组合平调成一个绿色或红色灯,消除了运营商的决定,远程测量旨在支持. 用诚实的限制执行检查 开始一个后果任务类型和三个不变. 当运行时间显示紧缩警告时,捕获前边界快照. 在启动指令重新加载后,并在下一次后续写之前捕获后边界快照. 在本地进行正常化消化,发出状态和时间印,并保留任何修订的批准参考. 不要使 PreCompact 成为通用阻塞门. 一个失败的可以消耗剩余的文本或线程正常工作. 如果无法编写预先截图,请记录 continuity evidence missing 并限制后续行动,直到安全的重复观察是可能的. 正确的反弹是不确定性,而不是假设的匹配. 不变组的设计也是不完整的. 哈什等式只证明记录的决策相匹配. 它不能揭示一个没有人选择记录的重要决定, 检查事件暴露缺失边界时的集合,并独立于代理总结验证最终结果. Sidewisp 目前处于私密预览阶段。 它的公共网站和文章库是现场,但生产代理 健康收集,背景监测适配器和恢复通常不发送. 产品方向与现有运行时间相结合,具有证据,可见的不确定性和人类权威,而不是替代运行时间或自主固定器. 目前,操作规则可以使用没有Sidewisp:观察紧缩事件,比较最小决策不变量,只接受明确的修改,并让缺失证据保持不明.