2026-08-01T05:02:09.866Z
Kontextingenieur für AI-Agenten: Überprüfung des Manus-Kontext-Loops
Verwandeln Sie die Manus-Kontext-Engineering-Lektionen in Quittungen für Cache-Stabilität, Werkzeugkontinuität, wiederherstellbarer Kontext, Fehlerbeweise, Fortschritt und Ergebnisse.
Die praktische Antwort auf Kontexttechnik für AI Agenten: Lektionen aus dem Baumannus besteht darin, sechs Schnelltricks nicht zu kopieren. Verwandeln Sie jede Lektion in eine Invariante, die Sie während eines Laufs überprüfen können. Ein stabiles Promptsprefix sollte eine Version und Hash haben. Ein Werkzeug, das in der Geschichte erwähnt wird, sollte immer noch ein lösbares Schema haben. Das kompakte Material sollte eine wiederherstellbare Referenz enthalten. Das aktuelle Ziel sollte eine Überarbeitung und eine Frische haben. Fehlgeschlagenen Handlungen sollten bewiesene Beweise hinterlassen. Wiederholte Aktionen sollten mit der Ausgangsveränderung verglichen werden. Ein Endbericht sollte immer noch eine Ergebnisbestätigung verlangen. Das gibt Ihnen einen Kontext Gesundheitsvertrag. Es kann den Unterschied zwischen einem effizienten Lauf, einem wiederherstellbaren Lauf, einem Lauf, der nützliche Fortschritte macht, und einem Lauf, den man tatsächlich sicher als vollendet bezeichnen kann, erkennen. Cache Hits und niedrigere Tokenzahlen helfen, aber keiner beweist, dass der Agent die Beweise bewahrt hat, die erforderlich sind, um richtig zu beenden. Lesen Sie die Manus Lektionen als Ansprüche mit Grenzen Das ursprüngliche Manus Ingenieurposten beschreibt die lokalen Entwurfsentscheidungen, die beim Aufbau seines Agentenrahmens erreicht wurden. Sein Autor berichtet von einem durchschnittlichen Input to Output Token Verhältnis von etwa 100:1 für Manus und argumentiert, dass das Verhalten von Prefix Cache daher sehr wichtig für Latenz und Kosten ist. Der Beitrag empfiehlt: das Prompte Präfix stabil und die Serialisierung deterministisch zu halten; Verhüllung von Aktionen anstelle der Entfernung von Werkzeugdefinitionen während der Laufzeit; die Externalisierung großer Kontexte für wiederherstellbare Dateien; eine Aufgabenliste neu zu schreiben, damit das Ziel wieder auf die jüngste Aufmerksamkeit gerichtet ist; die Aufbewahrung fehlgeschlagener Aktionen und Beobachtungen, damit sich das Modell anpassen kann; Einführung kontrollierter Variation, um sich wiederholenden Verhaltensmustern zu widersetzen. Das sind nützliche technische Hypothesen, nicht universelle Schwellenwerte. Die Caches der Anbieter unterscheiden sich. Einige Laufzeiten können historische Werkzeugschemas sicher verarbeiten. Eine URL kann aufbewahrt werden, später jedoch nicht zugänglich. Rohstapelspuren können Geheimnisse enthalten. Das Ziel alle acht Schritte wiederholen ist ein Testwert, kein allgemeines Gesetz. Unabhängige Beweise argumentieren auch gegen die Behandlung der angekündigten Kontextkapazität als Gesundheitsgarantie. Anthropic s Kontexttechnische Leitlinien stellt den Kontext als den vollständigen Schlussfolgerungszustand Systemanweisungen, Tools, externe Daten und Nachrichtengeschichte und empfiehlt, den kleinsten Hochsignal Satz zu halten, der das gewünschte Verhalten unterstützt. Es beschreibt auch Just in Time Rückrufung, progressive Offenlegung, Kompaktion, strukturierte Notizen und Multi Agent Separation als verschiedene Strategien mit unterschiedlichen Kosten. Chromas kontrollierten Kontext Rot Evaluierung testeten 18 Modelle, wobei die Eingabelänge unterschiedlich war und nicht einheitliche Abbau berichtet wurde. Ablenker, semantische Entfernung und Heuhaufenstruktur veränderten die Leistung. Die operative Implikation ist bescheiden, aber wichtig: innerhalb der Kontextgrenze ist kein Urteil. Sie brauchen immer noch Beweise dafür, dass der aktuelle Kontext die aktuelle Entscheidung unterstützt. Erstellen Sie eine Quittung für sechs Kontextmutationen Erfassen Sie Hashes und Zähler, nicht Roh Anweisungen. Jeder Entscheidungspunkt kann eine nützliche Quittung beigefügt werden: Die Felder beantworten unterschiedliche Fragen. Prefix Stabilität ist eine Effizienzprüfung. Erfassen Sie die stabile Vorlageversion und einen Content Hash über das cacheable Präfix. Aus diesem Präfix werden flüchtige Werte wie ein Zeitstempel pro Anfrage ausgeschlossen, wenn die Laufzeit dies zulässt. Eine Hash Änderung ist nicht automatisch ein Aufgabenfehler: Wenn sich die nützliche Ausgabe noch bewegt, klassifizieren Sie den Lauf als abgeschwächt und untersuchen Sie den Churn. ZZ ist eine Prüfung der Integrität der Entscheidungen. Behalten Sie ein versionertes Schema Register oder eine explizite Übersetzung von historischen Tool Anrufen zu ihrem definierenden Vertrag. Wenn in einer vorherigen Aktion browser fetch angegeben ist, aber der aktuelle Kontext diese Aktion oder eine kompatible Version nicht mehr definiert, kann das Modell aus einem unvollständigen Datensatz argumentieren. Das sollte ein gesundes Urteil blockieren. Restorbarer externer Kontext ist eine Wiederherstellungsprüfung. Ein Dateipfad, ein Objektschlüssel, eine Abfrage oder eine URL ist nur eine Referenz. Vergleichen Sie es mit einer Integritätsaufnahme, wenn möglich, einer letzten Überprüfung der Reichweite, des Umfangs und der Operation, die es wiederherstellt. Ein Dokument aus dem Live Fenster zu fallen, während eine verifizierte Referenz bewahrt wird, ist eine umkehrbare Kompression. Wenn man es ohne nützliche Referenz fallen lässt, ist das Beweisverlust. Zielsüchtigkeit ist eine Aufmerksamkeitsprüfung. Eine Überarbeitung des Aufgabenplans sollte das aktive Ziel, die akzeptierten Einschränkungen, die abgeschlossenen Meilensteine und die nächste Entscheidung identifizieren. Messen Sie sein Alter in Schritten oder Zeit. Fügen Sie nicht unendlich doppelte Pläne hinzu; aktualisieren Sie eine kompakte Quittung, wenn sich die Arbeit signifikant ändert oder ihre Frischkeitsgrenze abläuft. Fehlerbehalten ist eine Lern und Prüfprüfung. Zählen Sie gescheiterte Aktionen und bewahrte Fehlerregister. Speichern Sie die Fehlerklasse, das Werkzeug, die Versuchsidentität, die Entscheidung erneut zu versuchen und eine bearbeitete Vergabenicht willkürliche Rohleistung. Wenn zwei Ausfälle aufgetreten sind, aber nur ein sicherer Aufzeichnis bleibt, kann ein späterer erneuter Versuch nicht aus vollständigen Beweisen gerechtfertigt werden. Wiederholung gegen Fortschritt ist eine Driftprüfung. Eine wiederholte Aktion ist nicht eine Schleife an sich: Paginierung, Umfragen und begrenzte Wiederversuche können legitim sein. Kombinieren Sie eine Aktionssignatur mit einem Output Delta Zähler, objektiver Frische, Abhängigkeitszustand und erneuten Budgetversuch. Drei wiederholte Aktionen mit veränderten Artefakten können funktionieren; drei ohne Delta Staat verdienen ein Loop Risiko Urteil. Die Lehren von stabilem Präfix und kontrollierter Variation widersprechen sich nicht. Halten Sie das cachable Präfix und die Werkzeugverträge deterministisch. Die notwendige Variation nach diesem Präfix in Beispielen, Aktionsbeobachtungen oder einer begrenzten Auswahlpolitik anwenden und messen, ob sie einen nützlichen Fortschritt verändert. Anstelle der Durchschnittssignale eine Vorrangsregel anwenden Diese Felder sollten nicht in eine unsichtbare Punktzahl zusammengestellt werden. Eine billige, stabile Präfixversion mit nicht wiederherstellbarem Kontext ist überwiegend nicht gesund. Verwenden Sie Vorrang: 1. unsafe historische Werkzeugreferenzen sind nicht gelöst, zusammengestellte Beweise sind nicht wiederherstellbar oder ein Fehlerregister ist verschwunden; 2. loop risk das Ziel ist veraltet und die Aktionen wiederholen sich ohne Ausgangsänderung; 3. unverified der Vertreter meldet die Endleistung ohne gültige Ergebnisbestätigung; 4. healthy alle Kontextinvarianten passieren und das spezifische Ergebnis der Aufgabe verifiziert wird; 5. Degraded Kontextintegrität bleibt intakt, aber Vorzeichen Churn oder ein anderer Effizienzfehler ist vorhanden; 6. WORKING Invarianten passieren, nützliche Ausgangsänderungen und der Lauf ist nicht terminal. Diese Aufordnung macht Integritätsfehler bewusst stärker als Effizienzgewinne. Das Begleitgerät ändert eine Bedingung nach der anderen: Das erwartete Ergebnis: Die acht Fälle umfassen ein verifiziertes Ergebnis, nützliche Zwischenfortschritte, Präfix Churn, Werkzeug Schema Drift, irreversible Kompaktion, gelöschte Fehlerbeweise, veraltete Zielwiederholung und gemeldete Fertigstellung ohne Quittung. Ein Ergebnis ist absichtlich unangenehm: Der Fall cache churn ist degraded , nicht unsicher. Sein Präfix hat sich geändert, aber Schemata, Referenzen, Fehler und nützliche Fortschritte bleiben intakt. Im Gegensatz dazu ist irreversible compaction unsafe , obwohl sein Präfix stabil ist. Das ist der Unterschied zwischen einem Kostenproblem und einem Beweisproblem. Überprüfen Sie die Quittung, ohne das Gespräch abzuholen. Der Beleg sollte aufzeigen, ob Beweise vorhanden sind, ohne die Beweise selbst hochzuladen. Für das Präfix behalten Sie einen Vorlage Identifikator und Verwässerung. Behalten Sie für Werkzeuge die Schemaversion, den Aktionsnamen und das Kompatibilitätsergebnis. Für den externen Kontext behalten Sie eine beschränkte Referenz, Verdauung, Byteszahl, Reichbarkeitsergebnis und Frischkeitszeit. Bei Fehlern behalten Sie eine veränderte Klasse und einen Versuchs Identifikator. Für Fortschritte halten Sie Hashes oder Zähler für erwartete Artefakte. Befehle, Antworten, Anmeldeinformationen, Rohwerkzeugnutzlasten und absoluten Host Pfaden aus der geteilten Telemetrie halten, es sei denn, ein separater, expliziter Datenvertrag erfordert dies. Verwenden Sie drei Tests, bevor Sie den Vertrag annehmen. Zuerst laufen Sie ein Single Mutation Replay aus. Beginnen Sie mit einem bekannten Anschluss und ändern Sie nur ein Feld. Das Urteil sollte sich aus dem Grund bewegen, den Sie erwarten. Wenn die Entfernung einer wiederherstellbaren Referenz den Staat gesund macht, ist die Regel zu schwach. Zweitens, führen Sie einen redaction Canary aus. Setzen Sie ein synthetisches Geheimnis in eine fehlerhafte Nutzlast, verarbeiten Sie es durch den Quittungs Builder und behaupten Sie, dass das Geheimnis fehlt, solange die Fehlerklasse und die Entscheidung erneut zu versuchen überlebt. Die Aufbewahrung der Fehlerzeugnisse erlaubt nicht die Aufbewahrung sensibler Inhalte. Drittens: Führen Sie ein Ergebnis Konterbeispiel aus. Führen Sie dem Klassifizierern eine Nachricht des Endvermittlers mit, während Sie den tatsächlichen Lieferbefehl zurückhalten. Es muss unverified zurückgeben. Hinzufügen Sie dann die Task spezifische Überprüfungeine Dateiverarbeitung, den Pass Test, das Ziel API Lesen oder die menschliche Genehmigungund bestätigen Sie, dass nur diese Änderung healthy zulässt. Die Prüfung der Ergebnisse ist notwendigerweise arbeitsspezifisch. Eine Forschungsaufgabe erfordert möglicherweise eine zitierte Quelle und einen gespeicherten Bericht. Eine Bereitstellungsaufgabe erfordert möglicherweise eine Live Gesundheitsreaktion und Versionsparität. Eine E Mail Aufgabe erfordert möglicherweise das Lesen des Ziel Postfachs. Es gibt keinen nur kontextbezogenen Beweis dafür, dass ein willkürliches Ziel erreicht wurde. Verwenden Sie den Vertrag als Grenze und nicht als Produktanspruch Der Manus Post ist wertvoll, weil er echte Designspannungen aufdeckt: Cache Effizienz gegenüber veränderlichem Kontext, kleinere Fenster gegenüber irreversiblem Verlust, stabiles Verhalten gegenüber Wiederholung und Fehlerreinigung gegen Lernbeweise. Der operative Schritt besteht darin, diese Spannungen überprüfbar zu machen. Übernehmen Sie den Vertrag , wenn Sie diese Fragen für einen echten Lauf beantworten können: Hat sich das cacheable Präfix geändert, und war das erwartet? Kann man jede historische Handlung des Werkzeugs noch interpretieren? Kann man jede verlassene Beobachtung wiederherstellen und die Integrität überprüfen? Ist das aktuelle Ziel frisch genug für die nächste Entscheidung? Hat jede gescheiterte Aktion sichere Beweise hinterlassen? Verändern sich wiederholte Aktionen den Aufgabenzustand? Welche eigene Quittung beweist das gewünschte Ergebnis? Wenn eine Antwort auf die Integrität unbekannt ist, bewahren Sie unknown oder unsafe ; nicht grün herstellen. Wenn nur die Effizienz abgeschwächt wird, während die Beweise und die Fortschritte solide bleiben, wird die Laufzeit weiterhin funktionieren und das Kostenproblem separat behoben. Sidewisp befindet sich derzeit in einer privaten Vorschauphase. Seine öffentliche Erfahrung ist eine Website für den frühen Zugang und eine interaktive Demonstration; die Sammlung von Produktionsagent Gesundheit und die Kontextüberwachung werden im Allgemeinen nicht versandt. Die beabsichtigte Produktrichtung besteht darin, Beweise wie Frische, Kontextkontinuität, nützliche Fortschritte und verifizierte Ergebnisse in eine klare Gesundheitssicht zu verwandeln und gleichzeitig Unsicherheit und Genehmigungsgrenzen sichtbar zu halten.