2026-08-01T07:43:53.967Z

MCP代币使用:每结果测量4个桶

在选择代币减少策略之前,将MCP方案,发现转折和工具结果归因于一个验证结果.

应按 验证结果 测量MCP代币使用,而不是按服务器,工具调用或聊天. 有用的总数是需要产生所需结果的每个模型调用中所消耗的输入,分为四个桶:基线说明,暴露的工具方案,发现历史和工具结果有效载荷. 只有当每个候选人获得相同的结果后,才能比较优化候选人. 这一规则避免了两种常见的错误. 供应商会议总数不能告诉您计划或结果是否导致增长. 即使代理人选择错误的工具或遗漏交付值, 首先计算,保存结果合约,然后一次改变一个表面. 在优化之前建立一个四桶的本书 MCP工具规范定义了 tools/list 用于发现,并给每个工具一个名称,描述和输入方案. 客户端可以在向模型呈现工具之前转换响应,因此MCP本身不收代币. 在一个任务中,记录: 子 属于它的东西. 为什么它会生长 基线 系统说明,用户任务,请求包装 在每次采样调用中重复 方案 工具名称,描述,输入方案,客户端暴露的注释 更多的工具,词语描述,重复曝光 发现 搜索匹配,选定的工具描述,之前的发现转折 渐进的披露增加了往返旅行 结果 在消息历史中保留的工具输出 单词有效载荷和重复连接 总结整个路径的每个桶,成一个结果: 保持供应商缓存读取,缓存写入,输出代币,延迟和价格在邻近列中. 不要默默地将它们混合在四个输入桶中. 他们回答不同的问题. 一个缓存方案可能对一个提供商成本更低,同时仍然占据了文本,并且仍然需要清新性检查. 在测量之前定义结果收据. 在下面的实验中,任务是:返回当前的支付API错误率,观察时间和证据来源. 只有当所有三个领域都存在时,一个跑步才会通过: 这比成功返回的工具更严格. 没有观察时间的运输水平成功可能会变得过时. 没有证据来源的百分比不能调查. 紧输出只有在保留下次决策所需的字段时才有用. 计算准确的请求,而不是猜测的文本比例 使用相同的模型,系统提示,消息和工具来使用目标供应商的计数器. 人类s 代币计数文档 表示,终端点接受与消息请求相同的结构化输入,包括工具. 它还将结果标记为估计,并建议与预期模型进行计算. 飞行前的请求可以看起来像这样: 永远不要把钥匙放进JSON器件或报告中. 保存返回输入数量,使用模型标识符,计时时间,请求哈希,暴露的工具数量,呼叫号码和结果ID. 在每个模型/工具转换后再次运行计算器,因为发现和结果历史改变下一个输入. 如果您的提供商没有计数器,请使用固定的本地代币作为比较代理,而不是作为发票事实. 保持序列化器和代币化版本的固定. 这篇文章的装置使用 js tiktoken 1.0.21与 cl100k base ;这可以在三个场景中复制,但它不是Claude代币. 下面的百分比是对设备相对形状的证据,而不是普遍的MCP节省. 实际上,40个工具的尺寸是什么? 这种可检查的文物创造了40种合成操作工具. 一个工具返回请求的支付错误率证据;其他39个工具具有现实的名称,描述和JSON方案,但对此任务无关. 它比较了三个途径: 1. 揭露所有40项方案并保留一个有口头的结果; 2. 仅暴露已知工具,并保持紧的结果; 3. 暴露 search tools , describe tools 和 execute tool ,然后发现一个方案并保留紧的结果. 每个路径都通过了相同的三场收据. 测量的代理输入是: 场景 电话 基线 方案 发现 结果 总数 储蓄 : : : : : : : 静态40工具,词语结果 2 110 8,768 0 625 9,503 基线 选择的工具,结果紧 2 110 188 0 55 353 96.3% 动态发现,紧的结果 4 220 572 309 55 1,156 87.8% 主要的观察是归因,而不是标题百分比:重复的方案在静态路径中贡献了9,503个代理代币中的8,768个. 仅仅削减结果就无法弥补工作负担. 相反,当正确的工具已经知道的时候, 一个工具的路径超过了动态发现,因为发现增加了模拟调用数量两倍,并增加了309个历史代币. 设备和柜台足够小,可以检查: 在设置成本或文本窗口门之前,重现结构与您的真实工具定义,但用供应商的计数器取代代理. 另外,要用确定实际产品或外部效应的确定性检查来取代合成成功收据. 这些结果与更大的简单的动态工具集基准的方向一致:渐进的工具曝光可以大大减少静态方案输入,但需要更多的工具调用,并且可以增加延迟. 他们的百分比来自他们的工具集,任务和模型. 他们不是你的承诺. 在最大的桶中选择控制器 使用本书来选择一个干预: 如果方案占主导地位,并且从路由环境中知道所需的工具,请暴露被允许的子集. 如果方案占主导地位,但工具未知,请测试动态搜索和描述与检索错误案例. 如果结果占据主导地位,只投影与决定相关的领域,并保持新鲜度,覆盖性,错误和证据引用. 如果基线占主导地位,缩短重复指令或将稳定政策与具体任务背景分开. 如果发现占主导地位,改进路由,重新使用安全的范围选择,或接受更大的静态子集. 不要从安装代币优化器开始. 一个40个工具的CRM表面可能会证明逐步发现. 一个定期检查的健康检查总是调用一个已知只读的计量工具, 对于动态发现,测试失败就像储蓄一样积极. 包含模糊的用户术语,几乎重复的工具名称,不可用的工具,权限丢失,过时的工具列表以及不应该选择任何工具的查询. 测量选择精度和P95时间到验证结果. 仅仅在方案减少超过其检索和延迟成本时,额外的搜索步骤才是值得的. 结果紧缩需要自己的边界. 每当它们影响下一步行动时,保持标识符,单位,观察时间,覆盖范围,错误状态和证据参考. 避免完整记录,复制散文,未使用的元数据和原始日志. 如果一个紧的结果消除了运营商可以信任或复制判决的原因,那就是数据丢失. 使用一个简单的促销门: 设置目标,而不是复制设备. 如果结果质量,工具选择,新鲜度或验证下降,则退出. 少的代币不是恢复信号,完成的MCP调用并不是预期工作发生的证据. 保持健康界限明确 代币增长可能表明重复的方案,超大工具结果,重试或文本积累. 它也可能是合法的:一个新的工具成为必要的,调查需要证据,或者代理人正在等待而不是循环. 解释本书,除了有用的进展和预期结果之外. Sidewisp 目前处于私密预览阶段。 它的产品方向包括时间和预算效率作为一个代理健康信号,但有计划收集和优化现场代币使用; 实际的步骤是保持自己的结果账本,保存证据, 然后,决定是具体的:使用已知稳定工具路线的选择暴露,通过检索测试验的大型不确定表面的动态发现,以及当有效载荷历史是实际成本时的结果投影. 仅在相同的结果收据仍然通过后才发布变更.