2026-08-01T07:44:04.940Z

Optimiser l'utilisation des jetons OpenClaw sans endommager les résultats

Mesurer les économies de jetons OpenClaw lors de nouvelles sessions, réduire le contexte répété et promouvoir un changement uniquement lorsque le même résultat vérifié survient.

Le moyen le plus sûr de optimiser l'utilisation du jeton OpenClaw est de changer une source de contexte à la fois, de mesurer deux nouvelles sorties et d'exiger la même réception de résultats des deux. Un nombre de jetons inférieur n'est pas une victoire si l'agent oublie une décision, répète une action externe ou retourne une réponse plausible au lieu de l'artefact demandé. Lors d'un test contrôlé le 28 juillet 2026, j'ai remplacé 4 102 octets d'historique de répétition par un résumé des preuves de 924 octets. Les deux nouvelles séances OpenClaw ont utilisé le même modèle, le hash du système, la tâche, le SHA 256 attendu et le prédicat de sortie. L'utilisation des entrées est passée de 24 605 à 23 614 jetons: 991 jetons de moins, soit 4,0%. Le JSON retourné, 72 jetons de sortie, digeste d'artefact et verdict de passage étaient identiques. C'est la preuve d'une décision étroite répétion de la procédure tout en conservant les erreurs terminales et les reçus de résultats non une prévision selon laquelle chaque charge de travail permettra d'économiser 4%. L'interrupteur du système était beaucoup plus grand que l'enregistrement modifié, et chaque variante ne fonctionnait qu'une seule fois. Sidewisp est actuellement en préversion privée. Mesurer le prompt que vous pouvez réellement changer Le contexte OpenClaw est plus que le dernier message utilisateur. Son guide de contexte officiel répertorie le prompt du système, l'historique des conversations, les appels et les résultats des outils et les pièces jointes en tant que contributeurs. Les schémas d'outils comptent même s'ils ne sont pas affichés comme un texte ordinaire. Les compétences ajoutent une liste compacte de métadonnées; leurs instructions complètes sont chargées sur demande. Commencez par des preuves, pas par une série de nettoyages. /context detail localise de grands fichiers de démarrage, des schémas d'outils, des entrées de compétences et des messages de transcriptions compactables. /usage tokens expose les champs de jetons et de cache par réponse. /status affiche le dernier instantané de contexte et l'utilisation de la dernière réponse. Ces surfaces répondent à différentes questions. La distinction est importante car OpenClaw maintient la comptabilité de l'utilisation du fournisseur séparée de l'instantané de contexte actuel. Comme l'explique le référence à l'utilisation des symboles, les totaux des fournisseurs peuvent inclure des entrées, sorties et appels en cache multiples en boucle d'outils, tandis que l'affichage contextuel utilise le dernier instantané instantané. Ne déduisez pas l'un de l'autre et appelez le reste des déchets. Enregistrez au moins ceci avant un changement: Gardez les fenêtres des quotas, les totaux des comptes facturés et les jetons par course dans des colonnes distinctes. Une page d'utilisation de l'abonnement peut répondre à combien de capacité reste? sans prouver quelle fonction locale l'a consommée. Une entrée de transcription peut attribuer un modèle d'appel sans prouver l'existence du délivrable prévu. Exécution d'un test contrôlé avant et après L'expérience a utilisé un incident de facturation exportation synthétique afin que l'entrée puisse être publiée sans exposer des informations privées ou des journaux. La ligne de base contenait deux tentatives de temps d'arrêt, des lignes de progression répétées et une tentative réussie. La variante optimisée a conservé le nombre de tentatives, les deux faits de délai de termination, l'état de sortie final, le chemin de l'artefact, le SHA 256 exact, le résultat du test et l'état final; il a supprimé les lignes répétées qui n'ont pas changé la décision. Chaque variante s'est déroulée dans une nouvelle séance avec des personnes handicapées mentales. Le vérificateur a exigé une forme exacte de JSON et a refusé de passer à moins que l'artefact n'existe, que sa digestion ne corresponde et que les tests soient passés. Une commande réutilisable ressemble à ceci: Exécutez le fichier optimisé sous une nouvelle clé de session différente. Gardez l'agent, le modèle, le niveau de pensée, la tâche, le contrat de sortie et la configuration du système fixes. Si les hashs de l'instruction du système diffèrent, la comparaison est contaminée et doit être répétée. Le résultat observé a été: Mesure Ligne de référence Optimisé Le changement : : : Fichier d'entrée 4 102 octets 924 octets −77.5% Les jetons d'entrée 24,605 23,614 −991 (−4.0%) Tokens de sortie 72 72 Aucun changement Résultat exact JSON passe passe conservé Artéfacts SHA 256 correspondance correspondance conservé Les tests passe passe conservé La grande différence entre la réduction des fichiers et la réduction des entrées totales est la conclusion utile. Dans les deux circuits, OpenClaw a signalé le même prompt système de 33 883 caractères. La suppression de 3 178 octets d'un enregistrement ne pouvait donc pas supprimer 77,5% de l'ensemble du prompt. C'est pourquoi une capture d'écran spectaculaire d'un tronc plus petit n'établit pas une réduction spectaculaire des factures. Le temps du mur est passé de 28,7 à 21,8 secondes, mais un échantillon par variante ne suffit pas à attribuer la latence au changement de contexte. La variance du modèle de service, les files d'attente et les conditions du réseau sont incontrôlables. Traiter la latence comme non prouvée jusqu'à ce que plusieurs répétitions interlevées montrent une distribution stable. Supprimer la répétition sans supprimer la décision Utilisez le plus petit levier qui cible le plus grand contributeur mesuré. Pour l'ancienne sortie d'outil, OpenClaws documentation de taille des séances décrit la taille en mémoire qui taille les résultats des outils éligibles tout en laissant intacte la transcription sur le disque. Il préserve les virages récents et peut éliminer les grands résultats avant de les éliminer avec difficulté. C'est mieux adapté pour une sortie de commande volumineuse que de réécrire du texte normal de conversation. Pour une longue histoire de conversation, /compact crée un résumé et conserve les messages récents. Le guide de compactage dit que le résumé est persisté dans la transcription tandis que l'historique complet reste sur le disque. Guider le résumé vers la tâche: La compaction a une limite. Une requête plus petite qui perd une clé d'idempotence, l'état d'approbation ou la digestion attendue peut entraîner des travaux coûteux et dangereux. Après compression, demandez à l'agent de réécrire le contrat de résultat et de le comparer avec le reçu stocké avant de continuer. Les retraités ont besoin de leur propre contrôle. OpenClaws politique de retrait vise explicitement à réessayer la demande actuelle, à préserver la commande et à éviter la duplication d'opérations non idempotentes. Ne résolvez pas un temps d'arrêt en reproduisant tout un flux en plusieurs étapes. Vérifiez d'abord si l'effet externe s'est déjà produit. Puis réessayez seulement l'étape idempotente non résolue, avec une limite de tentative difficile. Un enregistrement compact devrait toujours répondre: Quelle étape a échoué, et avec quelle erreur finale? Un effet externe a t il été observé avant le délai? Est ce que la prochaine action est idempotente ? Combien de tentatives restent ? Quelles preuves prouveront qu'il est guéri? Tout ce qui ne peut pas changer ces réponses est un candidat à la coupe. Tout ce qu'il faut pour répondre reste. Économies de porte sur le résultat vérifié La réduction des jetons et la qualité des résultats appartiennent au même rapport d'essai. Utilisez un reçu déterministe lorsque la tâche le permet: l'existence de fichiers plus digest, les résultats des tests, la ligne de base de données plus la clé d'idempotence, le statut HTTP plus le hash de réponse ou un identifiant de message spécifique à la destination. Utilisez un juge LLM uniquement pour les propriétés qui ne peuvent pas être vérifiées directement. Appliquer la règle de la décision suivante: Testez un levier à la fois: taille des outils, compression guidée, fichiers de démarrage plus courts, dimensions d'image plus petites, descriptions de compétences plus courtes ou un modèle différent. Le fait de les changer tous ensemble peut réduire une facture, mais cela vous empêche d'apprendre quel changement a aidé et lequel a endommagé la fiabilité. Également séparer l'économie du cache de la réduction des jetons bruts. Un préfixe répété stable peut être moins cher en lecture de cache qu'un prompt short réécrit constamment. À l'inverse, un gros prompt recouvert après l'expiration de sa durée de vie peut être coûteux. Rapportez les entrées, sorties, lecture de cache, écriture de cache et hypothèses de prix locales séparément; n'inventez jamais de coût lorsque le prix du modèle manque. Le résultat contrôlé supporte ici un défaut pratique: retenir les erreurs et les reçus terminaux, répéter l'effondrement et juger le changement par rapport au même produit livré. Il ne prend pas en charge la suppression agressive, un pourcentage d'épargne universel ou la déclaration de succès à partir des seuls comptes de jetons. La direction du produit de Sidewisp inclut l'utilisation planifiée des jetons et l'intelligence des coûts estimés pour OpenClaw et d'autres temps d'exécution des agents, mais cette capacité n'est pas expédiée aujourd'hui. L'expérience en direct est un site d'accès précoce et une démonstration de produits. Si une vue de santé qui relie l'utilisation aux résultats vérifiés aiderait vos opérations, vous pouvez rejoindre l'aperçu privé sans modifier votre heure d'exécution ou l'itinéraire des appels de modèle via Sidewisp.