2026-08-01T12:22:45.532Z
图形 LLM可观察性:证明结果层
执行Grafana的生成和OpenTelemetry路径,然后检查运行时间,等待,效果和目的地证据,
Grafana LLM可观测性可以为您提供模型调用,代理代,痕迹,工具活动,延迟,代币,成本和评估的强大信息. 它本身不能证明一个代理人在预期时可以到达,等待合适的人,使用外部效应确切一次,或生产所需的交付物. 因此,实际的默认是两部分:使用Grafana为它记录的远程测量,然后为远程测量无法回答的问题添加一个小的操作证据合同. 检查这些部分单独. 在格拉法纳出现的对话并不是证据表明有痕迹和指标到达的证据, 这本指南将该边界与Grafana的当前文档和 @grafana/agento11y JavaScript包进行了比较. 它还包括7个案例的审计,使得接受规则可执行,而不是作为仪表板建议. 开始记录的路径,然后试试一下 格拉法纳目前揭示了两条相关路线. 它的通用AI可观察性设置默认地通过Grafana Cloud OTLP门口发送OpenTelemetry痕迹,指标和日志;当您需要路由,转换或更好的控制在更高的体积时,OpenTelemetry收藏器或Grafana合金是文档的替代品. 它的最新的代理可观察性表面添加了以代理为导向的生成,对话,工具调用,工作流动步骤,代币和成本数据,评估和框架集成. 对于JavaScript,当前的包是 @grafana/agento11y . 在2026年7月27日检查时, npm latest 标签返回了版本 0.9.0 . 应该把它视为一个已过期的执行快照,而不是一个永久版本的建议. 最短记录的开始是这样的: 然后从环境变量中配置SDK,而不是将访问令牌放入源: 相关环境变量名称以 AGENTO11Y ENDPOINT , AGENTO11Y PROTOCOL , AGENTO11Y AUTH MODE , AGENTO11Y AUTH TENANT ID 和 AGENTO11Y AUTH TOKEN 为文档. 不要在日志中打印它们的值,也不要将它们附在痕迹上. 在Grafana的JavaScript仪器指南中,有一个容易忽略的界限: SDK可以发送生成数据,但它需要应用配置的 TracerProvider 和 MeterProvider 来出口它发射的范围和指标. 没有这些供应商,指南说, 这使得一个可见的谈话是一个弱的设置测试. 换来使用三个独立探测器: 1. 创建一个具有独特的测试ID的代码,并在 Conversations 中找到它. 2. 在痕迹数据源中找到具有相同相关性ID的跨度. 3. 在测试窗口中查询一个 SDK 发布的指标,并确认其资源属性识别预期的服务和环境. 如果没有探测器,设置失败. 不要把三分数平均成一个令人安慰的分数: generation=yes, trace=no, metric=no 是部分远程测量,而不是一个健康的装置. 一个完整的Grafana痕迹仍然是活动证据 格拉法纳记录了有用的报道. 代理可观察性可以捕获代代,工具调用,工作流程步骤,延迟,错误,代币,成本,质量分数和版本比较. 这些信号可以回答诸如: LLM电话失败了吗? 哪个模型和代理版本处理了逃跑? 他们使用了哪些工具? 运行耗费了多少代币和多少代价? 一个配置的评价或警卫是否产生了分数? 其他国家 开通电气技术GenAI代理会议 让活动具有可携带的词汇库. 在研究时,代理公约明确标记了开发状态,包括调用代理或工作流程,规划和执行工具的操作. 发展状况是重要的:将仪器版本固定,并期望属性或跨度形状发展. 任何一个跨度名称都不能定义你的业务结果. 提供者在不同步地应用请求,验证后拒绝请求,或写到错误的对象时,一个 execute tool 跨度可以报告成功的HTTP响应. 完成的工作流跨度可以与缺失的文件共存. 一项质量评估可以评分生成的文本,而计划的运行从未开始. 使用一个证据地图,说明证据及其边界: 证据飞机 它可以确定 它不确定 释放探针 产品出口 一个记录的模型生成达到代理可观察性 经过出口的痕迹和指标 找一个独特的对话ID 痕迹 仪器操作及其因果性途径 外部目的地现在有预期状态 查询相关的跨度 计量 汇总率,持续时间,错误,代币和成本信号 一个需要运行或交付的成功 查询确切的测试窗口 评价 一名名得分的球员与供应物品相对而战 通过确定目的地声明 保留得分分者版本和输入范围 运行时间收据 运行时间可以达到预期的时间 完成任务 与心跳年龄和SLA进行比较 等待收件 暂停有原因,所有者,截止日期和恢复处理 主人会及时决定. 检查路由和升级 效果收据 外部操作可以调整 用户的完整结果现有 通过稳定运行ID重新读取 结果收据 通过了特定目的地声明 未来的稳定性 在稳定窗口中重新检查 这不是加载更多内容的理由. 偏好ID,时间标签,版本,低卡丁度状态,哈希,计数和目的地声明,而不是原始提示,完成,工具有效载荷,秘密或文件路径. 合同在仪器化之前设计时,丰富的远程测量和数据最小化是兼容的. 执行7例覆盖情况审计 我把地图转化为一个小的确定性装置. 每个案例都记录了是否成功的生成,追踪和计量出口;是否远程测量和运行时心跳是新鲜的;是否运行有合法的等待;是否有外部影响被调整;以及是否预期的结果得到了权威的收据. 分类器采用优先级而不是算法: 七个灯具覆盖: 没有一代人到来; 产量到达,但跨度和指标没有; 所有的远程测量都存在,但已过时; 代理人正正确等待与所有者,截止日期和恢复代币; 一项工具尝试没有收到一致效果; 远程测量和工具证据是绿色的,但可交付的产品是缺失的; 同样填写的案例具有可授权交付的收据. 地方重播通过了所有预期的七个分类: 最有用的比较是最后两个案例. 两者都有生成,追踪和指标出口. 两者都是新鲜的. 两者都报告了完成运行和验证了工具效果. 第一个没有目的地声明,被归类为 false success ;第二个添加 object:report 17 加上内容哈希,成为 verified . 这种变化是故意的. 没有仪表板,代币数量,模型分数或跟踪状态变化. 只有用户请求所要求的证据才会发生变化. 审计有一个严格的局限性:它相信所提供的事实. 一个恶意或破产的收藏者可以说谎, 在生产中,在权威的边界生成结果收据存储读后写,数据库限制查询,部署健康调查,发送消息提供商搜索或与原始工作ID相关的其他确定性声明. 将覆盖范围转化为生产接受门口 在启用新代理版本,框架集成,收集路线或样本更改之前运行一个仪器式的鱼. 给鱼一个独特的工作身份证和一个无害的预期结果. 然后要求所有适用的证据: 代码: 代码存在于加拿大ID下. Trace: 根跨度和所需的儿童操作可查询. Metric: 卡纳里窗口为预期系列做出贡献. 新鲜度: 收藏器延迟低于声明的限制. 运行时间: 心跳或时间表收据证明运行时间是预期时可达的. 在等待: 任何暂停都会说明其原因,授权所有者,决策截止日期,升级路线,并恢复操作. E 效果: 副作用操作与稳定的无效率或供应商操作ID相结合. O 结果: 一个权威的目的地检查证明所需的文物或状态存在. 隐私: 测试查询确认禁止的提示,响应,秘密和路径字段缺失. 让判决不方便. telemetry partial 应阻止仪器部署. 当证据过时, health unknown 应防止绿色状态. waiting 应在重新启动合法工作的情况下通知所有者. uncertain effect 应该停止盲目的重试. false success 必须在跟踪正常结束时重新启动任务或事件. 采样需要另一个决定. 量需要时可以采样重量痕迹,但需要分类所需的紧健康证明不应随之消失. 保持足够的识别符来将采样的痕迹与未采样的运行,等待,效果和结果收据相关联. 否则更便宜的远程测量政策将会变得更弱的准确性政策. 还有运营成本. 目的地回收增加延迟和提供商通话;运行时心跳增加存储和新鲜度检查;等待收据需要路由所有权. 执行最小的确定性检查,以解决决定. 检查文件存在和哈希检查比问另一个模型是否可能存在文件更好. 当结果是语义时,LLM评判器仍然有用,但在确定性检查旁边记录其版本,标题,输入范围和不确定性. 适合Sidewisp的地方 格拉法纳是一个能够检查和相关的电力测量的地方. 在这里所描述的缺失层是可达性,进步,等待,效果和结果的操作判断,而不是另一个追踪观众. Sidewisp旨在成为现有药物运行时间周围的健康层,具有明确的证据,新鲜性,不确定性,批准界限和验证. 它不是替代运行时间或强制模型门户. 今天还没有发送生产监测器和恢复器. Sidewisp 目前处于私密预览阶段。 如果这些证据的边界与您操作代理的方式相匹配, 适当的下一步是加入私人预览等待列表, 描述您需要的运行时间和结果检查. 在那之前,保持格拉法纳的远程测量判决精确,