2026-08-01T07:43:51.680Z
Utilisation des jetons MCP: Mesurer quatre seins par résultat
Attribuer les schémas MCP, les tours de découverte et les résultats des outils à un résultat vérifié avant de choisir une stratégie de réduction des jetons.
L'utilisation des jetons MCP doit être mesurée par résultats vérifiés , et non par serveur, appel à l'outil ou chat. Le total utile est l'entrée consommée sur chaque appel de modèle nécessaire pour produire le résultat demandé, divisé en quatre seins: instructions de base, schémas d'outils exposés, historique de découverte et charges utiles des résultats des outils. Comparez les candidats à l'optimisation seulement après que chacun ait produit le même reçu de résultats. Cette règle empêche deux erreurs courantes. Un total de séances de fournisseur ne peut pas vous dire si des schémas ou des résultats ont causé la croissance. Un petit nombre de jetons peut sembler efficace même si l'agent a choisi le mauvais outil ou omis le délivrable. Comptez d'abord, conservez le contrat de résultat, puis changez une surface à la fois. Construisez un grand livre de quatre secours avant d'optimiser Le Spécification des outils du MCP définit tools/list pour la découverte et donne à chaque outil un nom, une description et un schéma d'entrée. Un client peut transformer cette réponse avant de présenter des outils à un modèle, de sorte que MCP lui même ne charge pas de jetons. Pour une tâche, enregistrer: Bouquet Ce qu'il y a à l'intérieur Pourquoi il pousse ? Ligne de référence instructions du système, tâche utilisateur, emballage de demande répété à chaque appel d'échantillonnage Schéma les noms des outils, les descriptions, les schémas d'entrée, les annotations exposées par le client plus d'outils, des descriptions verbales, une exposition répétée Découverte les correspondances de recherche, les descriptions des outils sélectionnés, les tours de découverte antérieurs la divulgation progressive ajoute des voyages aller retour Résultats sorties d'outils conservées dans l'historique des messages charge utile verbale et réattachement répété Résumez chaque seau à travers le chemin complet à un résultat: Gardez les lectures de cache du fournisseur, les écritures de cache, les jetons de sortie, la latence et le prix dans les colonnes adjacentes. Ne les mélangez pas silencieusement dans les quatre seaux d'entrée. Ils répondent à des questions différentes. Un schéma mis en cache peut coûter moins cher à un fournisseur tout en occupant encore le contexte et en ayant besoin de vérifications de fraîcheur. Définir la réception du résultat avant la mesure. Pour l'expérience ci dessous, la tâche était de: renvoyer le taux d'erreur de l'API de paiement actuel, le temps d'observation et la source de preuves. Une course ne s' est passée que lorsque les trois champs existaient: Ceci est délibérément plus strict que l'outil retourné avec succès. Un succès au niveau du transport sans temps d'observation pourrait être obsolète. Un pourcentage sans source de preuve ne peut être étudié. La sortie compacte n'est utile que lorsqu'elle conserve les champs nécessaires à la prochaine décision. Comptez la demande exacte, pas un ratio de texte deviné Utilisez le compteur du fournisseur cible avec le même modèle, le même prompt système, les messages et les mêmes outils que vous avez l'intention d'envoyer. Anthropics documentation de comptage des symboles indique que le point final accepte les mêmes entrées structurées qu'une demande de message, y compris les outils. Il étiquette également le résultat comme une estimation et conseille de compter sur le modèle prévu. Une demande de pré vol peut ressembler à ceci: Ne mettez jamais la clé dans l'appareil JSON ou dans un rapport. Enregistrez le nombre d'entrées retournées avec l'identifiant du modèle, le temps de comptage, le hash de la demande, le nombre d'outils exposés, le numéro d'appel et l'identifiant de résultat. Exécutez le compteur une fois pour la requête de base, puis à nouveau après chaque tour de modèle/outil car l'historique de découverte et de résultat modifie l'entrée suivante. Si votre fournisseur n'a pas de compteur, utilisez un tokenizer local coincé comme proxy de comparaison, pas comme un fait de facturation. Gardez la version de sérialisation et de jetonage réparée. L'appareil pour cet article utilise js tiktoken 1.0.21 avec cl100k base ; il est reproduisable dans ses trois scénarios, mais ce n'est pas un jeton Claude. Les pourcentages ci dessous constituent une preuve de la forme relative de l'appareil, et non d'une économie universelle de MCP. Qu'est ce que le dispositif de 40 outils a mesuré réellement L'artefact inspectable crée 40 outils synthétiques opérationnels. L'un des outils renvoie la preuve du taux d'erreur de paiement demandé; les 39 autres ont des noms réalistes, des descriptions et des schémas JSON, mais ne sont pas pertinents pour cette tâche. Il compare trois chemins: 1. exposer les 40 schémas et conserver un résultat verbeux; 2. exposer uniquement l'outil connu et conserver un résultat compact; 3. exposer search tools , describe tools et execute tool , puis découvrir un schéma et conserver le résultat compact. Chaque chemin a passé le même reçu de trois champs. Les entrées par procuration mesurées étaient: Scénario Les appels Ligne de référence Schéma Découverte Résultats Total Épargne : : : : : : : 40 outils statiques, résultat verbeux 2 110 8,768 0 625 9,503 ligne de départ Outil sélectionné, résultat compact 2 110 188 0 55 353 96.3% Découverte dynamique, résultat compact 4 220 572 309 55 1,156 87.8% L'observation dominante est l'attribution, pas le pourcentage de titre: les schémas répétés ont contribué à 8.768 des 9.503 jetons proxy dans le chemin statique. La seule réduction du résultat ne réparerait pas cette charge de travail. À l'inverse, lorsque l'outil correct était déjà connu, le chemin d'un outil a battu la découverte dynamique parce que la découverte a doublé le nombre d'appels de modèle et ajouté 309 jetons d'historique. L'appareil et le compteur sont suffisamment petits pour inspecter: Reproduisez la structure avec vos définitions d'outil réelles, mais remplacez le proxy par le compteur de votre fournisseur avant de définir un seuil de coût ou de fenêtre contextuelle. Remplacez également le reçu de réussite synthétique par une vérification déterministe de votre effet réel de livraison ou externe. Ces résultats sont en accord avec la direction d'un Indice de référence de l'ensemble d'outils dynamiques Speakeasy plus grand: l'exposition progressive des outils peut réduire considérablement l'entrée de schéma statique, mais elle nécessite plus d'appels aux outils et peut augmenter la latence. Leurs pourcentages provenaient de leurs ensembles d'outils, de leurs tâches et de leur modèle. Ils ne sont pas une promesse pour vous. Choisissez le contrôle dans le plus grand seau Utilisez le registre pour choisir une intervention: Si les schémas dominent et que l'outil requis est connu du contexte de routage, exposer un sous ensemble autorisé. Si les schémas dominent mais que l'outil n'est pas connu, testez la recherche dynamique et la description contre les cas de défaillance de récupération. Si les résultats dominent, projettez uniquement les champs pertinents pour la décision et gardez la fraîcheur, la couverture, les erreurs et les références à la preuve. Si la ligne de base domine, raccourcissez les instructions répétées ou séparez la politique stable du contexte spécifique à la tâche. Si la découverte domine, améliorez le routage, réutilisez une sélection en toute sécurité ou acceptez un sous ensemble statique plus grand. Ne commencez pas par installer un optimisateur de jetons. Commencez par le seau et la tâche. Une surface CRM de quarante outils peut justifier une découverte progressive. Un contrôle de santé régulier qui appelle toujours un outil métrique connu pour la lecture seulement ne le fera probablement pas. Pour la découverte dynamique, échouer les tests aussi agressivement que l'épargne. Inclure des termes utilisateur ambiguës, des noms d'outils presque dupliqués, des outils non disponibles, la perte d'autorisation, des listes d'outils obsolètes et une requête qui ne devrait pas sélectionner d'outil. Mesurer l'exactitude de la sélection et le temps P95 jusqu'au résultat vérifié. L'étape de recherche supplémentaire ne vaut la peine que lorsque la réduction du schéma dépasse son coût de récupération et de latence. La compaction du résultat a besoin de sa propre limite. Gardez les identifiants, les unités, le temps d'observation, la couverture, l'état d'erreur et une référence à la preuve chaque fois qu'ils affectent l'action suivante. Évitez les dossiers complets, la prose dupliquée, les métadonnées non utilisées et les journaux bruts. Si un résultat compact supprime la raison pour laquelle un opérateur peut faire confiance ou reproduire un verdict, c'est la perte de données. Utilisez une simple porte de promotion: Définissez les objectifs de votre charge de travail plutôt que de copier le fichier. Revenir en arrière si la qualité du résultat, la sélection des outils, la fraîcheur ou la vérification sont en régression. Moins de jetons n'est pas un signal de récupération, et un appel MCP terminé n'est pas la preuve que le travail prévu s'est produit. Gardez les limites de santé explicites La croissance des jetons peut indiquer des schémas répétés, des résultats d'outils surdimensionnés, des retries ou une accumulation de contexte. Il peut également être légitime: un nouvel outil devient nécessaire, une enquête a besoin de preuves, ou l'agent attend plutôt que de boucle. Interpréter le livre en plus des progrès utiles et des résultats attendus. Sidewisp est actuellement en préversion privée. La direction de son produit inclut l'efficacité du temps et du budget en tant que signal de santé d'agent, mais la collecte et l'optimisation de l'utilisation des jetons en direct sont prévues; cette capacité n'est pas expédiée aujourd'hui. L'étape pratique maintenant est de conserver votre propre registre par résultat, de préserver les preuves et de tester un changement d'exposition au MCP à la fois. La décision est alors concrète: utiliser l'exposition sélectionnée pour une route d'outil connu stable, la découverte dynamique pour une grande surface incertaine qui réussit les tests de récupération et la projection des résultats lorsque l'historique de la charge utile est le coût réel. Publier la modification seulement après que le même reçu de résultat ait encore passé.