2026-07-31T20:58:53.393Z
子 LLM可观察性:保持评估员的呼叫
审计Splunk评估器隔离, histogram远程测量,采样覆盖,卡丁度,内容捕获和结果证明之前信任绿色代理视图.
子LLM可观测性可以显示有助于仪器化代理的性能,质量,代币,估计成本和追踪证据. 然而,安全的操作默认是: AI代理页面已填充,因此代理是健康的. 首先证明测量管道是完整的,评估员的呼叫不被计算为应用工作,评估覆盖范围已知标号,以及所要求的结果存在于痕迹之外. 这本指南没有收集提示或答案的证据. 包含的八个案例设置产生无内容的收件,每个路线都运行到以下状态之一:摄入不完整,计量合同不匹配,评估者自行观察,高卡丁度风险,内容政策审查,评估覆盖率下降,可观察但未经验证,或健康,有覆盖和验证的证据. 在阅读成绩之前审核测量路径 现在的Splunk的设置文件使得两个远程测量细节在运行上很重要. 首先,对于AI代理监测页面,需要进行 histogram 计量. 如果使用SignalFx出口商,记录的收藏器设置是 send otlp histograms: true . 设置还通过: 可见的痕迹不能证明这个计量路径是正确的:跨度和 histograms可以独立失败. 第二,Python AI仪器可以在与应用程序相同的过程中执行评估. 据Splunk记录了这个开关,其默认是错误的: 在默认模式下,DeepEval等评价者所做的LLM呼叫可以与应用呼叫一起使用仪器. 设置为真实运行评估在儿童过程中,而开放Telemetry SDK已被禁用,防止评估员的呼叫污染应用程序远程测量. 在其他文档框架中,在启用评估时,Splunk标记了这种隔离,是OpenAI仪器所需的. 这种区别改变了图表的意义. 假设一个代理调用号召两次调用模型,然后一个评价者再调用三个模型. 如果评估者分享仪器化过程,一个天真的总体可以报告五次电话,它们的结合代币和它们的结合延迟. 额外的活动是真正的计算,但这并不是证据表明代理取得了更多进展. 它是测量工作,观察测量工作. 记录每次部署的无内容收据: 任何一个字段都不需要提示,响应,工具参数,秘密或客户标识符. 他们描述了证据管道的健康状况. 第3次检查回答了不同的问题: histogramsExported :收集者是否出口了AI监测页面所要求的 histogram远程测量? deltaTemporality :指标合同是否符合已记录的配置? aiSpanVisible :至少有一个新的GenAI跨度达到预期的Splunk视图吗? 不要把它们分解成一个 telemetry ok 布尔式. 如果跨度到达,但 histograms 没有, 痕迹调查可能是有效的, 而集成面板仍然是不完整的. 如果数据是旧的,一个填充的页面可能仍然旧. 在实践中,将证据来源和观察时间与收件相结合. 给每一个质量分数一个覆盖率指标 斯普朗克描述了AI代理质量分数,是通过一个指标的评估的百分比. 它的AI代理文档说,测量时间是为了计算这些分数, 这对于评估的样本可能是一个有用的规则. 这本身并不是证明每一个符合条件的调用均进行了评估,或者样本代表了每一个任务类型. 追踪四个数字: 1. 符合条件的申请范围; 2. 配置的评估样本率; 3. 完成的评估结果; 4. 评估队列下降. 对于确定性审计窗口,计算: 随着400个符合条件的跨度,0.25个样本率,100个评估和零下降,观察到的覆盖率为25%,符合配置的预期. 这意味着 Znot 的其他300个跨度通过了. 这意味着他们的评估状态是样本之外的. 在Splunk的Python配置中,也显示了评估队列大小. 一个正面的边框是反压力;当排队满时,新的物品会随着警告而下降. 文件建议根据吞吐量和内存,在1001000范围内设置一个界限,而零或未设置则让队列无界限. 两种选择都有一个妥协: 一个无限的队列可以将评估滞后转化为记忆压力; 一个有限的队列可以保存过程,但减少评估覆盖范围; 排队降落计数量为6个,意味着94项完成的评估不能以100%的样本率诚实地取代100项符合条件的评估. 因此,审计结果显示 EVALUATION COVERAGE DROPPED 是不健康的,也不是失败的代理. 代理人可能完成了有用的工作; 对于质量判决所需的证据是不完整的. 测量尺寸需要类似的边界. 斯普朗克允许将GenAI文本属性复制到度量尺寸中,但明确警告说, gen ai.conversation.id 可能会导致高cardinality问题. 在诊断需要时,保持每次谈话的身份. 不要自动将它转化为指标尺寸. 对于集成而言,一个低卡丁度的部署环境或租户层通常更安全;正确的集合仍然取决于流量和租户限制. 保持内容捕捉明确的例外 据Splunk的LLM服务文档显示,提示和响应收集默认关闭,并警告内容可能包含敏感或个人识别信息. 它的设置路径还指出,大量捕获的输入和输出可能超过后端限制并导致性能问题. 这项审计不需要内容. 它可以通过仅仅使用元数据验证历史图出口,时间性,过程隔离,样本采集,滴滴,尺寸,痕迹可见性和目的地收件. 如果单独的质量调查真正需要捕获的内容,请通过内容政策审查: 确定需要内容的精确评价者; 说明捕获是否发生在跨度,事件或两者之间; 文件保留,访问,掩盖和删除; 测试有效载荷尺寸行为; 验证工具定义不仅仅是因为已启用信息捕获而被捕获; 限制调查后禁用捕获,如果连续捕获不合理. 如果没有批准收据,该装置将返回 CONTENT POLICY REVIEW . 这项判决是故意不健康的,也没有被打破的. 它说仪器已经跨越了运营健康检查无法授权的数据界限. 同样的限制适用于估计成本. 斯普朗克表示,其代理成本估计将发布的提供商成本乘以可用的代币数量,并不是实际的发票. 标签估计,保留定价日期,不要默默地与发票或供应商特定缓存折扣结合. 执行8例证据审计 可复制的文物使用一个优先规则. 之前的发现阻碍了后来的绿色状态: 运行保存的设置: 它重复了8个案例,并返回了8个不同的结果: 覆盖和验证 HEALTHY COVERED VERIFIED : 要求的远程测量,声明的样本,零下降和结果一致. 评价者自行观察 EVALUATOR SELF OBSERVED : 评审员的呼叫可以进入应用程序远程测量. histograms missing INGESTION INCOMPLETE : 一条痕迹不能证明所需的指标已经到达. Z错误的临时性 METRIC CONTRACT MISMATCH : 出口的指标合同与记录的设置不同. 对话 ID as metric HIGH CARDINALITY RISK : 每次对话的身份被推进到一个测量维度. 内容捕获未经审查 CONTENT POLICY REVIEW : 没有收据的情况下过了一条敏感数据界限. 评价队列放弃 EVALUATION COVERAGE DROPPED : 94个结果不能代表预期的100个. 没有结果的轨迹 OBSERVABLE NOT VERIFIED : 执行证据存在,但承诺的结果没有. 这是一个合成配置审计,而不是现场Splunk合规测试. 它不能证明收藏器可达,角色包括所需的能力,保留覆盖一个事件窗口,或目的地包含预期的交付物. 如果不能测量值,则将固定值取代为环境中的观察,并保留 unknown . 在医疗判决之前,停止追踪. 斯普朗克的跟踪和AI交互视图回答有关模型操作,错误,代币使用,延迟和评估响应质量的重要问题. 医疗代理判决还有一个局限: 选择可用的最强的确定性目的地检查: 一个文件在预期的路径上存在,并与一个方案或哈希匹配; 在预期的存储库中存在抽取请求和承诺; 预期目的地有一个信息,其中预期无效密钥; 预期租户和运营身份证下可见数据库突变; 一个测试套件对生产的文物进行了测试; 人类批准仍在待定,所以运行是 waiting ,没有失败. 加入收据,以保证隐私的身份. 保持可传递的内容在其来源. 一个成功的跨度加上一个缺失的收据是 OBSERVABLE NOT VERIFIED ;它不是自动允许再次尝试,因为外部效应可能存在,但暂时无法读取. 实践规则很简单:信任Splunk视图经过自身测量路径后,在已知覆盖范围内解释质量分数,并且只有在预期结果单独验证后才明确代理健康. Sidewisp遵循相同的证据第一产品方向:区分活动与有用进展,揭露缺失证据,并将结果验证与跟踪完成分开. Sidewisp 目前处于私密预览阶段。 它的生产监测适配器和恢复引擎在此没有作为一般可用的介绍;公共场所是早期访问体验和产品展示. 来源 设置AI代理监测, 飞可观察性云文档. 为AI应用程序0.1.14及以上配置Python代理, 飞可观察性云文档. 最后更新于2026年6月16日的监控AI代理. 监控LLM服务,最后更新于2026年5月12日.