2026-08-01T07:44:02.732Z

Optimiza el uso de tokens OpenClaw sin debilitar los resultados

Medir los ahorros de tokens OpenClaw en sesiones nuevas, recortar el contexto repetido y promover un cambio solo cuando se sobreviva el mismo resultado verificado.

La forma más segura de optimize OpenClaw uso de tokens es cambiar una fuente de contexto a la vez, medir dos nuevas ejecuciones, y requerir el mismo resultado de recibo de ambos. Un recuento de tokens más bajo no es una victoria si el agente olvida una decisión, repite una acción externa o devuelve una respuesta plausible en lugar del artefacto solicitado. En una prueba controlada el 28 de julio de 2026, reemplacé 4.102 bytes de historial de ensayos repetidos con un resumen de evidencia de 924 bytes. Ambas sesiones recientes de OpenClaw usaron el mismo modelo, hash de solicitud de sistema, tarea, SHA 256 esperado y predicado de salida. El uso de entradas cayó de 24.605 a 23.614 tokens: 991 menos tokens, o un 4,0%. El JSON devuelto, 72 tokens de salida, digesto de artefactos y veredicto de aprobación fueron idénticos. Esto demuestra una decisión estrecha repetir el trino al tiempo que se conservan los errores terminales y los recibos de resultadosno un pronóstico de que cada carga de trabajo ahorrará un 4%. El aviso del sistema era mucho más grande que el registro cambiado, y cada variante se ejecutó solo una vez. Sidewisp se encuentra actualmente en versión preliminar privada. Medir el prompt que realmente puede cambiar El contexto de OpenClaw es más que el último mensaje del usuario. Su Guía de contexto oficial enumera el prompt del sistema, el historial de conversaciones, las llamadas y resultados de las herramientas y los archivos adjuntos como contribuyentes. Los esquemas de herramientas cuentan aunque no se muestren como texto ordinario. Las habilidades añaden una lista de metadatos compactos; sus instrucciones completas se cargan a pedido. Comience con la evidencia, no con una serie de limpiezas. /context detail localiza grandes archivos de arranque, esquemas de herramientas, entradas de habilidades y mensajes de transcripción compactables. /usage tokens expone los campos de token y caché por respuesta. /status muestra la última instantánea de contexto y el último uso de respuesta. Estas superficies responden a diferentes preguntas. La distinción es importante porque OpenClaw mantiene la contabilidad del uso del proveedor separada de la instantánea de contexto actual. Como explica el referencia de uso de tokens, los totales de proveedores pueden incluir entradas, salidas y llamadas múltiples de bucle de herramientas almacenadas en caché, mientras que la pantalla de contexto utiliza la última instantánea rápida. No deduzcan uno del otro y llaman el resto " desperdicio". Registra al menos esto antes de un cambio: Mantenga las ventanas de cuotas, los totales de cuentas facturadas y los tokens por ejecución en columnas separadas. Una página de uso de suscripción puede responder ¿cuánta capacidad queda? sin probar qué funcionamiento local la consumió. Una entrada de transcripción puede atribuir una llamada modelo sin probar que el producto de entrega previsto existe. Realizar una prueba controlada antes y después El experimento utilizó un incidente sintético de factura export para que las entradas pudieran ser publicadas sin exponer las instrucciones privadas o los registros. La línea de base contenía dos intentos de tiempo fuera, líneas de progreso repetidas y un intento exitoso. La variante optimizada conservó el recuento de intentos, tanto los hechos de tiempo de terminación, el estado de salida final, el camino del artefacto, el resultado exacto de la prueba SHA 256, y el estado final; eliminó líneas repetidas que no cambiaron la decisión. Cada variante se ejecutó en una nueva sesión con discapacitados de pensamiento. El verificador requirió una forma exacta de JSON y se negó a pasar a menos que el artefacto existiera, su digestión coincidiera y las pruebas pasaran. Un comando reutilizable se ve así: Ejecutar el archivo optimizado bajo una nueva tecla de sesión diferente. Mantenga fijo el agente, el modelo, el nivel de pensamiento, la tarea, el contrato de salida y la configuración del sistema. Si los hashes de la señal de sistema difieren, la comparación está contaminada y debe repetirse. El resultado observado fue: Medidas Línea de base Optimizado El cambio : : : Archivos de entrada 4.102 bytes 924 bytes −77.5% Tokens de entrada 24,605 23,614 −991 (−4.0%) Tokens de salida 72 72 No hay cambios Resultado exacto JSON el paso el paso conservados Artefacto SHA 256 juego juego conservados Pruebas el paso el paso conservados La gran diferencia entre la reducción de archivos y la reducción de la entrada total es el hallazgo útil. En ambas carreras, OpenClaw informó el mismo aviso del sistema de 33.883 caracteres. Por lo tanto, eliminar 3.178 bytes de un registro no podría eliminar el 77,5% de todo el prompt. Es por esto que una fotografía de pantalla dramática de un registro más pequeño no establece una reducción dramática de las facturas. El tiempo de pared cayó de 28,7 a 21,8 segundos, pero una muestra por variante no es suficiente para atribuir la latencia al cambio de contexto. La variación del modelo de servicio, las colas y las condiciones de la red no están controladas. Tratar la latencia como no comprobada hasta que varias repeticiones entrelazadas muestren una distribución estable. Eliminar la repetición sin borrar la decisión Utilice la palanca más pequeña que apunte al mayor contribuyente medido. Para la salida de herramientas antiguas, OpenClaws documentación de recorte de sesiones describe la poda en memoria que recorta los resultados de herramientas elegibles mientras deja intacta la transcripción en disco. Preserva las curvas recientes y puede cortar suavemente los grandes resultados antes de limpiar con dificultad a los más viejos. Eso es mejor para la salida de comandos voluminosos que reescribir texto normal de conversación. Para un largo historial de conversaciones, /compact crea un resumen y mantiene mensajes recientes. El Guía de compactación dice que el resumen persiste en la transcripción mientras el historial completo permanece en disco. Guía el resumen hacia la tarea: La compasión tiene un límite. Una petición más pequeña que pierda una clave de idempotencia, estado de aprobación o digestión esperada puede causar una reelaboración costosa e insegura. Después de la compactación, pídale al agente que reafirme el contrato final y compararlo con el recibo almacenado antes de continuar. Los retiros necesitan su propio control. OpenClaws política de retraso tiene como objetivo explícitamente retomar la solicitud actual, preservar el pedido y evitar duplicar operaciones no idempotentes. No resuelva un tiempo de espera reproduciendo todo un flujo de múltiples pasos. Primero compruebe si el efecto externo ya ha ocurrido. Luego vuelva a intentar sólo el paso idempotente sin resolver, con un límite de intentos difíciles. Un registro compacto de retraso debe responder: ¿Qué paso falló, y con qué error terminal? ¿Se observó un efecto externo antes del tiempo límite? ¿La próxima acción es impotente? ¿Cuántos intentos quedan? ¿Qué evidencia demostrará que se recuperará? Cualquier cosa que no pueda cambiar esas respuestas es un candidato para el recorte. Todo lo necesario para responderles se queda. Ahorros por puertas en el resultado verificado La reducción de tokens y la calidad del resultado pertenecen al mismo informe de ensayo. Utilice un recibo determinístico cuando la tarea lo permita: existencia de archivo más digesto, resultados de prueba, fila de base de datos más clave de idempotencia, estado HTTP más hash de respuesta, o un ID de mensaje específico de destino. Utilice un juez LLM sólo para propiedades que no puedan ser verificadas directamente. Aplicar esta regla de decisión: Pruebe una palanca a la vez: recorte de herramientas grandes, compactación guiada, archivos de arranque más cortos, dimensiones de imagen más pequeñas, descripciones de habilidades más cortas o un modelo diferente. Cambiarlos todos juntos puede reducir una factura, pero evita que aprenda cuál cambio ayudó y cuál dañó la confiabilidad. También separa la economía de caché de la reducción de tokens crudos. Un prefijo repetido estable puede ser más barato como lectura de caché que un prompt short constantemente reescrito. Por el contrario, una gran solicitud recavada después de que expire su tiempo de vida puede ser costosa. Reporte las entradas, salidas, lectura de caché, escritura de caché y suposiciones de precios locales por separado; nunca invente un costo cuando falta el precio del modelo. El resultado controlado aquí apoya un defecto práctico: retener errores terminales y recibos, repetir el colapso y juzgar el cambio con el mismo producto entregado. No apoya la eliminación agresiva, un porcentaje de ahorro universal, o declarar el éxito solo a partir de los recuentos de tokens. La dirección del producto de Sidewisp incluye la inteligencia de uso de tokens planificada y de costos estimados para OpenClaw y otros tiempos de ejecución de agentes, pero esa capacidad no se entrega hoy. La experiencia en vivo es un sitio de acceso temprano y una demostración de productos. Si una vista de salud que conecte el uso a los resultados verificados ayudaría a sus operaciones, puede unirse a la vista previa privada sin cambiar el tiempo de ejecución o el enrutamiento de las llamadas de modelo a través de Sidewisp.