2026-08-01T10:18:37.264Z

Agent AI qui s'améliore lui-même: promouvoir les changements, ne pas s'auto-éditer en direct

Fermez tous les changements de comportement proposés, comparez-les à leurs parents exacts, protégez les budgets de régression, et gardez l'autorité et le retour hors de la boucle rédactible.

Un agent AI qui s'améliore lui même ne devrait pas réécrire son comportement en direct et appeler le progrès de la réécriture. Le défaut le plus sûr est de traiter chaque prompt proposé, mémoire, récupération, politique d'outil ou changement de code comme un candidat de sortie non fiable. Fermez le candidat, comparez le avec son parent exact sur des preuves qu'il ne peut pas modifier, vérifiez chaque métrique protégée, prouvez qui peut l'approuver, et gardez une cible de rétroaction résolvable. Ce n'est qu'alors qu'un petit changement réversible peut pénétrer dans un canary limité. Cette règle permet encore de s'améliorer. Ça change l'unité de confiance. Les commentaires peuvent générer automatiquement un candidat; l'activation nécessite des preuves. La distinction est importante parce que l'auto amélioration couvre plus que la formation de modèle. Le Réflexion stocke la rétroaction verbale dans la mémoire épisodique afin que les essais ultérieurs se comportent différemment sans mise à jour de poids. Le L'auto réfinition alternera la rétroaction et le raffinement en utilisant le même modèle. Un prompt de routage, une leçon récupérée, une liste d'autorisations d'outils ou un script écrit peuvent changer la prochaine course aussi sûrement qu'un nouveau point de contrôle. Votre registre des changements doit couvrir chacune de ces surfaces. Congeler le candidat avant de le mesurer Commencez par deux identités immuables: le parent actif et le candidat. Des enregistrements utiles de manifestes de changement: Le digeste empêche une édition silencieuse entre l'évaluation et le canary. L'identité mère empêche un candidat généré contre agent v41 d'être promu sur un agent v42 maintenant actif. La liste des surfaces écrites révèle le vrai rayon de l'explosion. Une proposition décrite comme une "leçon de mémoire" n'est pas si petite si son processus peut également modifier la politique de l'évaluateur ou de l'autorité. Ne laissez pas le candidat écrire ses cas de retrait, code de marquage, seuils d'acceptation, politique d'approbation, ou l'historique du retrait. C'est la règle, la serrure et la sortie d'urgence. Un agent qui peut les changer peut augmenter son score sans améliorer la tâche. C'est aussi la raison pour laquelle un fichier d'apprentissage uniquement en appendice mérite une version. Une courte leçon peut rediriger la récupération, supprimer l'escalade ou le choix d'outils biaisés à travers chaque course ultérieure. Seule la mémoire modifiée décrit le mécanisme de stockage et non le risque opérationnel. Comparer le parent exact et le candidat sur des preuves verrouillées Un score absolu est une preuve faible. Exécutez le parent et le candidat contre les mêmes identifiants de cas, la version de l'environnement, les fixations d'outils, la politique de randomisation et le vérificateur de résultats. Conservez les résultats combinés. La question n'est pas de savoir si le candidat a obtenu un score de 0,86 ? Le Livre de cuisine d'agent autonome OpenAI démontre une boucle pratique avec une ligne de base, une rétroaction humaine ou modèle, des évaluations, un seuil de score, une limite de réessayer et une ligne de base mise à jour. C'est une machine utile pour générer et mesurer des candidats. Une décision de promotion de la production a besoin d'un seuil plus strict qu'un seuil global, car les moyennes cachent quel bien a payé pour le gain. Supposons que le succès de la tâche passe de 0.80 à 0.89 , tandis que l'intégrité de l'effet outil passe de 0.99 à 0.96 . La moyenne peut augmenter. Le changement échoue toujours si des effets externes dupliqués ou manquants sont inacceptables. Faire préciser les mesures cibles et les mesures protégées: La métrique Direction Règle de promotion Succès de la tâche Plus élevé Le candidat doit s'améliorer d'au moins 0.03 L'intégrité de l'effet outil Plus élevé Aucune régression n'est autorisée Route d'approbation Plus élevé La régression ne peut dépasser 0.02 Coût par résultat vérifié Plus bas L'augmentation ne doit pas dépasser 0.05 Utilisez des mesures liées aux résultats observables. Une commande qui sort de zéro n'est pas la preuve qu'un délivrable existe. Un appel à l'outil dans une trace n'est pas la preuve que la destination a changé exactement une fois. Un juge modèle peut aider avec la qualité subjective, mais il ne devrait pas annuler un fichier déterministe, une base de données, une autorisation ou une vérification des effets. L'ensemble verrouillé doit inclure des défaillances connues et des attentes valides. Dans le cas contraire, l'agent peut sembler s'améliorer en devenant plus agressif: moins d'escalade, moins de questions, une finition plus rapide et plus d'effets secondaires erronés. Inclure au moins une mesure hors bande que le candidat n'optimise pas directement. Autorités de proposition séparées de l'autorité d'activation Le fait de laisser un agent proposer un changement n'implique pas l'autorité pour l'activer. Définir l'homologation par surface et rayon d'explosion. Un petit changement de routage rapide pourrait entrer dans un canary de 20 tâches dans le cadre d'une politique préapprouvée. Une politique de récupération ou un changement de politique d'outil peut nécessiter un nom humain. Le code d'exécution, la logique de l'évaluateur, la portée des accréditations et les actions irréversibles devraient rester hors de la promotion automatique. Les lignes directrices de l'OWASP sur les excès d'agence recommande des autorisations minimales, une autorisation en aval et une approbation humaine pour des actions à fort impact. Appliquer la même séparation à l'auto modification. Le processus d'amélioration n'obtient que la capacité nécessaire pour écrire un artefact candidat. Une composante différente, plus petite, possède l'évaluation et la promotion. Un reçu d'autorité utile comprend: Accroître la réception au digeste du candidat dans une mise en œuvre réelle. Il expire. N'acceptez pas que l'agent puisse s'améliorer comme une autorisation exécutable; il manque d'une surface, d'une limite et d'une limite temporelle. Attendre l'approbation n'est pas un échec. Si les preuves passent mais que la surface de changement nécessite une personne, retournez AWAITING APPROVAL avec la digestion candidate, les delta mesurés, la surface demandée, la cible de retour et la taille proposée du canary. La course est saine quand cette attente a un propriétaire et une décision réalisable. Remplissez les portes dans un ordre fixe. L'ordre rend le résultat explicatif. Rejeter les problèmes structurels avant de débattre des scores: 1. Identité: le digeste est valide et le parent du candidat est toujours actif. 2. Surface protégée: le candidat ne peut pas écrire des tests, des données de détention, une autorité, un historique de rétroaction ou une autre surface interdite. 3. Démotions partagées: parent et candidat ont utilisé le même ensemble de preuves verrouillées. 4. Budget de régression: chaque métrique protégée reste à son niveau. 5. Rollback: la version précédente nommée est toujours résolue. 6. V gain de matériau: l'amélioration cible élimine le plancher prédéclaré. 7. AAutorité: le reçu correspond à la limite de surface et de canarie. Les cinq premières portes protègent la sécurité et l'audit. Le gain matériel empêche le churn: un changement qui produit du bruit mais ne doit pas être amélioré, pas promouvoir simplement parce qu'il a passé les contrôles de sécurité. L'Autorité décide entre l'examen canarien et l'examen humain. L'appareil d'accompagnement met en œuvre cette priorité sans appel modèle. Exécutez le dans le répertoire des objets: Les huit candidats partagent délibérément une histoire de succès plausible: la plupart augmentent le score cible. Leurs décisions diffèrent: Le candidat Décision Des preuves décisives Partage rapide sécurisé CANARY READY Gain partagé, aucune régression protégée, autorité limitée Changement de récupération AWAITING APPROVAL Les preuves passent; la surface nécessite une personne Petite leçon de mémoire HOLD NO MATERIAL GAIN Bien sûr, mais le gain cible est seulement 0.01 Parents stériles BLOCKED IDENTITY Le candidat a été généré à partir de la base active erronée. Écrivain d'évaluation BLOCKED PROTECTED SURFACE Le candidat peut changer de régulateur. Des affaires privées fraîches BLOCKED EVIDENCE Le candidat n'a pas utilisé l'ensemble verrouillé Le gagnant agrégé BLOCKED REGRESSION L'intégrité de l'effet de l'outil a chuté par 0.03 Une ancienne version manquante BLOCKED ROLLBACK L' artefact renvoyé nommé n' est pas disponible Le résultat utile n'est pas un score de sécurité composé. Il s'agit d'un état et d'une limite de réparation. Un parent obsolète a besoin de régénération. Une régression protégée nécessite un diagnostic. Une cible manquante doit être restaurée. Une moyenne de ces échecs cacherait la propriété. Canary le changement, pas votre confiance Le fait de passer des portes hors ligne rend un candidat admissible à un canary; cela ne prouve pas la santé de la production. Limitez les tâches, le temps, les dépenses, les outils et les effets secondaires. Gardez le parent disponible. La route du canary ne fonctionne que si le résultat peut être vérifié de manière indépendante. Comparer ses reçus en direct avec une ligne de base parentale concurrente ou récente si la charge de travail le permet. Définir les déclencheurs de rétroaction avant l'activation: violation de la métrique protégée, taux de résultat inconnu, effets dupliqués, défaillance des approbations, plafond de dépenses ou défaillance de la fraîcheur des preuves. Le retour à l'emploi signifie la restauration exacte de l'artefact parent et la vérification du retour du résultat de la tâche prévue. Une commande de retour qui a été terminée est l'activité, pas la récupération. Gardez trois enregistrements après le canarien: les candidats immuables et les digestes parentaux; des éléments de preuve couplés hors ligne et canariens, y compris des signaux indisponibles; la décision de promotion, de rétention, d'approbation ou de rétroaction accompagnée de la réception de son autorité. Si les preuves disparaissent, retournez UNCERTAIN et arrêtez la promotion. Ne convertissez pas une mesure absente en une valeur saine. Si la même proposition échoue à plusieurs reprises, le cap essaie à nouveau et le redirige vers une personne plutôt que de laisser la boucle d'amélioration consommer un temps et des jetons illimités. Sachez ce que cette porte ne peut pas prouver L'audit fourni vérifie la forme manifeste, la priorité, les delta métriques couplées, l'étendue de l'autorité et la résolution de rétroaction. Cela ne prouve pas que votre retard représente la production, qu'une rubrique humaine est correcte, ou qu'un échec rare apparaîtra dans 20 tâches canaries. Les tests peuvent devenir obsolètes. Les évaluateurs peuvent partager les points aveugles du modèle. Les outils externes peuvent changer après le passage du candidat. La défaillance pratique est donc limitée: automatiser librement la génération de candidats, automatiser soigneusement l'évaluation à faible risque et automatiser l'activation uniquement à l'intérieur d'une enveloppe d'autorité explicite. Gardez les surfaces à fort impact et irréversibles approuvées par l'homme. Continuez à surveiller après la promotion, car un agent qui s'améliore lui même n'est sain que lorsque ses résultats utiles restent sainset non lorsque son pipeline de mise à jour est occupé. Sidewisp est actuellement en préversion privée. Son orientation est d'ajouter une couche de santé autour des temps d'exécution des agents existants, avec des preuves, des limites d'approbation et une vérification des résultats; les adaptateurs de surveillance de la production et les systèmes de récupération ne sont généralement pas expédiés. Si cette limite correspond à la façon dont vous opérez avec des agents, vous pouvez rejoindre la prévisualisation privée.