2026-08-01T22:24:02.731Z
LLM 没有快速泄漏的可观察性:安全的电气通信合同
保持工具失败,重试,时间和结果可见,而不需要将提示,凭证,参数或结果复制到您的远程测量商店中.
LLM可观测性应解释 哪个操作运行,什么失败,需要多长时间,是否重新尝试,以及预期结果是否存在 . 它不需要复制每一个提示,工具参数或工具结果到一个远程测量后端来回答这些问题. 安全生产默认是内容最小化的包裹:相关性ID,操作和工具名称,低卡丁度错误类,时间,尝试号码,输入 关键名称 ,结果形状以及独立的结果判决. 仅用于特定调查的信息或工具内容,具有明确的权威,短的保留窗口和与数据相匹配的存储控制. 这本指南构建了默认的数据,并对三个故意敏感的代理事件进行了测试. 追踪行动,而不是私人有效载荷 LLM可观测性的广泛定义包括痕迹,指标,日志,评估,模型行为和应用结果. 对代理运营商来说,有用的问题更窄:证据能否区分一个缓慢的模型调用,一个被拒绝的工具调用,一个合法的等待,一个重试循环, 目前的开放Telemetry GenAI语义公约提供了一个有用的开始词汇. 执行工具跨度使用 gen ai.operation.name 和 gen ai.tool.name ;它还描述了一个工具调用ID,工具类型和 error.type . 同样的文件标记工具调用参数和结果为选择,并警告说,这两者都可能包含敏感信息. 这些公约在 Development 中,所以将你实现的版本定位,并预计会发生变化. 这种分离在操作上是合理的. 下面的字段通常回答第一个事件响应问题,而不复制内容: 领域 答案是什么? 收藏规则 trace id , run id , step id 这次事件属于哪个执行阶段? 保持不透明的标识符;不要从内容中提取它们. operation , tool name , tool type 他们试图做什么工作? 使用有边界的,记录的名称. status , error type 它失败了吗? 偏好 timeout 或 permission denied ,而不是免费形式提供者消息. duration ms , attempt 慢慢或重复? 记录数字,而不是叙事. input keys 要求的形式是什么? 保存关键名称;默认丢弃值. result shape 工具没有回复任何东西,一个阵列,或者一个对象? 保存类型,数值或最高级别的键;丢弃值. outcome check , outcome status 用户预期的结果登陆了吗? 检查与工具完成分别. content captured 有没有其他地方? 让边界可见和可查询. run id 和以上的结果字段是应用合同,而不是OpenTelemetry标准属性. 这是故意的:追踪词汇和具体任务的健康证据解决相关但不同的问题. 一个允许列表超过了无限的编辑列表 编写代码问, 我们记得删除哪些危险值? 一个允许者问, 哪些领域获得了离开过程的权利? 据欧亚斯普伐木骗局表表示, 访问代币,密码,数据库连接字符串,加密密钥和敏感个人数据通常不应该直接记录. 它还将文件路径和内部网络细节视为需要特别处理的数据. 代理工具经常处理那列表上的每一个项目. 免费形式的错误信息是常见的后门. 这是不安全的: 操作上有用的版本较小: 它仍然支持集成,警报路由,重新尝试分析,并与保护的本地记录相关. 它不会将可观测性存储器变成秘密载有错误的副本. 关键名字也需要判断. calendar id 显示的值不到其值,但像 customer alice hiv status 这样的密钥已经包含了内容. 保存工具名称和关键名称的批准方案;拒绝或将意外名称映射到 other . Cardinality 不仅仅是一个成本问题它是一个数据边界问题. 在三种敌对装置上复制消毒剂 附带的装置包含了三个假但现实事件: 1. 通过虚假电子邮件和载体代币进行成功的日历查找; 2. 拒绝预览发布,具有虚假的API密钥和私有路径; 3. 用假连接字符串和电子邮件编写一个截止时间的数据库. 清洁剂不会反复寻找秘密模式. 它从一个允许列表构建一个新的对象: 在文章的证据包中运行检查的文物: 复制的输出保留了诊断: 它也支持具体的结论. 完成了日历工具,通过了结果检查. 预览呼叫需要许可,而不是盲目重新尝试. 在第二次尝试中,等待列表写出时间,并且耐用记录检查失败,所以返回命令不是成功条件. 字节对字节的差异通过了. 单独搜索所有植入的加拿大运载符号,API键,连接字符串,电子邮件值和私人路径, 这是一个有用的测试,要在IC中保持:将一个独特的假加在每个敏感装置上,如果它越过出口国界,就会失败. 内容捕获是升级模式 无内容的远程测量具有真正的局限性:它不能解释为什么提示被语义误解,或者模型反应是否包含了微妙的事实错误. 因此,边界应该是受控的升级,而不是绝对的说法,即内容永远是有用的. OpenTelemetry的内容捕获指导表示,指令,用户信息和模型输出是敏感的,通常是很大的,并且不应该默认地捕获. 它描述了独立的外部存储,具有不同的访问控制,作为必须保留敏感内容时的生产选择. 在启动该模式之前,请决定以下所有情况: 具体运营,工具或租户范围; 谁批准收藏,谁可以阅读收藏; 在出口前过哪些字段; 最长时间和保留时间; 存储区域和访问控制; 如何验证删除; 模式如何自动返回 content captured: false . 采样不是编辑. 一个百分比的样本仍然可以捕捉一个包含证书的提示. 加密也不是最小化:它保护存储的字节,但不证明收集它们或防止授权过度曝光. 首先是允许列表,然后只需无法以其他方式回答操作问题,再添加一个单独的法医路径. 加入远程测量到一个结果,然后决定 一个可观测性事件描述了一个操作. 代理健康需要一个事实:预期的工作是否实现了? 数据库驱动程序可以返回成功,而后续的交易则会退回. 在错误的路径中,文件编写工具可以退出零. 一个消息API可以接受请求,而目的地则会异步拒绝它. 因此,远程测量包裹应包含确定性结果检查的名称和状态,而不复制结果内容. 使用下列决定序列: 1. O输出通过: 即使发生过渡性重试,也关闭操作;保留重试信号以进行成本和可靠性分析. 2. Tool失败,结果失败: 路由由稳定错误类. 只要操作是可逆的,并且在批准的限制范围内,再试一次. 3. Tool成功,结果失败: 分类错误成功,调查工具和验证器之间的合同. 4. O 结果未运行: 工作未完成. 安排或执行检查. 5. E证据缺失或相互矛盾: 标记不确定状态,并在积极干预之前要求. 这将活动与有用的进展和命令完成与用户的结果分开. 它还使恢复更安全:运营商可以准备一个有限的操作,然后在结果检查通过后才清除问题. 产量缺陷 对于大多数LLM和代理工作负载,从一个小的,记录的远程测量许可程序开始. 保持相关性,操作,稳定的错误,时间,尝试,形状和结果领域. 默认关闭内容. 用种植的鱼来测试出口商. 将临时内容捕获视为单独授权的事件程序. 这种默认不会回答每一个法医问题. 它会回答日常健康问题,而不需要默默地创建一个包含提示,身份证,客户记录和工具结果的阴影数据库. Sidewisp的产品方向是将可用性,执行,内存,工具,结果和成本证据转化为清晰的健康视角,同时保持人类权威,只收集所需的东西. Sidewisp 目前处于私密预览阶段。 公共网站和文章是现场;生产监测适配器和自动恢复通常不出货. 如果证据界限符合你想要运营代理的方式,你可以加入私人预览等待列表.