2026-08-01T10:18:37.968Z
Agente AI che si auto-migliora: promuove i cambiamenti, non auto-editare in diretta
Fermare ogni cambiamento di comportamento proposto, confrontarlo con il suo genitore esatto, proteggere i budget di regressione, e mantenere l'autorità e il rollback al di fuori del ciclo di scrittura.
Un agente AI che si auto migliora non dovrebbe riscrivere il suo comportamento in diretta e chiamare il progresso della riscrizione. Il default più sicuro è quello di trattare ogni suggerimento, memoria, recupero, politica degli strumenti o modifica del codice come un candidato non affidabile. Congelare il candidato, confrontarlo con il suo genitore esatto su prove che non può modificare, verificare ogni metrica protetta, provare chi può approvarlo, e mantenere un obiettivo di rollback risolvibile. Solo allora un piccolo cambiamento reversibile può entrare in un canario confinato. Questa regola consente ancora di migliorare. Cambia l'unità di fiducia. Il feedback può generare un candidato automaticamente; l'attivazione richiede prove. La distinzione è importante perché l'auto miglioramento copre più di una formazione modello. Riflessione memorizza il feedback verbale nella memoria episodica in modo che gli studi successivi si comportino in modo diverso senza aggiornamento di peso. Auto rifinamento alterna feedback e raffinamento utilizzando lo stesso modello. Un prompt di routing, una lezione recuperata, un listino di strumenti o uno script scrivibile possono alterare la prossima esecuzione con la stessa sicurezza di un nuovo checkpoint. Il tuo libro dei cambiamenti deve coprire tutte quelle superfici. Congelare il candidato prima di misurarlo Iniziamo con due identità immutabili: il genitore attivo e il candidato. Un utile registro del manifesto di cambiamento: La digestione impedisce una silenziosa edizione tra valutazione e canario. L'identità genitore impedisce che un candidato generato contro agent v41 venga promosso su un agent v42 ora attivo. L'elenco della superficie scritturabile rivela il vero raggio dell'esplosione. Una proposta descritta come una lezione di memoria non è così piccola se il suo processo può anche modificare la politica di valutazione o di autorità. Non lasciare che il candidato scriva i suoi casi di sospensione, il codice di punteggio, le soglie di accettazione, la politica di approvazione o la cronologia del rollback. Queste sono la regola, la serratura e l'uscita di emergenza. Un agente che li può cambiare può aumentare il suo punteggio senza migliorare il compito. Questo è anche il motivo per cui un file di apprendimento con appendice solo merita di essere modificato. Una breve lezione può reindirizzare il recupero, sopprimere l'escalation o la scelta di strumenti di pregiudizio in ogni successiva esecuzione. Solo la memoria modificata descrive il meccanismo di archiviazione, non il rischio operativo. Confronta il genitore esatto e il candidato su prove chiuse Un punteggio assoluto dei candidati è una prova debole. Eseguire il modello di riferimento e il candidato contro gli stessi ID di caso, la versione dell'ambiente, le apparecchiature degli strumenti, la politica di casualità e il verificatore dei risultati. Immagazzinare i risultati accoppiati. La domanda non è: ha il candidato ottenuto un punteggio di 0,86? è: cosa è cambiato rispetto al genitore, in quali casi e a quale costo? Il Libro di cucina di OpenAI dimostra un ciclo pratico con una linea di base, un feedback umano o modello, valutazioni, una soglia di punteggio, un limite di ripetizione e una linea di base aggiornata. Questa è una macchina utile per generare e misurare i candidati. Una decisione di promozione della produzione ha bisogno di un limite più rigoroso di una soglia aggregata, perché le medie nascondono quale proprietà ha pagato per il guadagno. Supponiamo che il successo del compito sali da 0.80 a 0.89 , mentre l'integrità dell'effetto strumento scende da 0.99 a 0.96 . La media potrebbe salire. Il cambiamento non è ancora possibile se gli effetti esterni duplicati o mancanti sono inaccettabili. Rendere esplicite le metriche mirate e le metriche protette: Metrica Direzione Regola di promozione Successo della missione Alti Il candidato deve migliorare almeno di 0.03 Integrità dell'effetto strumento Alti Nessuna regressione consentita Routing dell'approvazione Alti La regressione non può superare 0.02 Costo per risultato verificato Al di sotto L'aumento non può superare 0.05 Utilizzare metriche legate ai risultati osservabili. Un comando che è uscito da zero non è la prova che un deliverable esiste. Una chiamata di strumento in una traccia non è la prova che la destinazione sia cambiata esattamente una volta. Un giudice modello può aiutare con la qualità soggettiva, ma non dovrebbe superare un file deterministico, database, autorizzazione o controllo degli effetti. L'insieme bloccato deve includere i fallimenti noti e le attese valide. Altrimenti l'agente può sembrare migliorare diventando più aggressivo: meno escalation, meno domande, completamento più veloce e più effetti collaterali sbagliati. Includere almeno una misura fuori banda che il candidato non ottimizza direttamente. Autorità di proposta separata dall'autorità di attivazione Lasciare che un agente proponga un cambiamento non implica l'autorità di attivarlo. Definire l'approvazione per superficie e raggio di esplosione. Un piccolo cambiamento di orientamento rapido potrebbe entrare in un canario di 20 compiti in base a una politica pre approvata. Una politica di recupero o un cambiamento della politica degli strumenti può richiedere un nome umano. Il codice runtime, la logica dell'evaluatore, il campo di applicazione delle credenziali e le azioni irreversibili dovrebbero rimanere al di fuori della promozione automatica. Orientazione dell'OWASP sull'eccessivo funzionamento dell'Agenzia raccomanda autorizzazioni minime, autorizzazione downstream e approvazione umana per azioni ad alto impatto. Applicare la stessa separazione all'auto modificazione. Il processo di miglioramento ottiene solo la capacità necessaria per scrivere un artefatto candidato. Una componente diversa e più piccola è responsabile della valutazione e della promozione. Una ricevuta di autorizzazione utile comprende: Approfondire la ricevuta al digesto del candidato in un'attuazione reale. Scadere. Non accettare che l'agente possa migliorarsi come un permesso eseguibile; manca una superficie, un limite e un limite temporale. Aspettare l'approvazione non è un fallimento. Se le prove passano, ma la superficie del cambiamento richiede una persona, restituire AWAITING APPROVAL con la digestione candidata, i delta misurati, la superficie richiesta, l'obiettivo di ritorno e la dimensione del canario proposta. La corsa e' sana quando quell'attesa ha un proprietario e una decisione ricomprensibile. Fate funzionare i cancelli in ordine fisso L'ordine rende il risultato spiegabile. Rifiutare i problemi strutturali prima di discutere i punteggi: 1. IDENTITÀ: la digestione è valida e il genitore del candidato è ancora attivo. 2. Protected surface: il candidato non può scrivere test, dati di detenzione, autorità, storia di rollback o altra superficie proibita. 3. Dostrazioni abbinate: genitori e candidati hanno utilizzato lo stesso set di prove bloccate. 4. Budget di regressione: ogni metrica protetta rimane all'interno del proprio limite. 5. Rollback: la versione precedente denominata si risolve ancora. 6. Guadagno materiale: il miglioramento obiettivo elimina il pavimento predeterminato. 7. AAutorità: la ricevuta corrisponde al limite di superficie e di canarie. I primi cinque cancelli proteggono la sicurezza e l'auditabilità. Il guadagno materiale impedisce la rottura: un cambiamento che produce rumore ma non deve essere migliorato, non promuovuto semplicemente perché ha superato i controlli di sicurezza. L'autorità decide tra la revisione canaria e quella umana. L'apparecchio di accompagnamento impiega tale priorità senza una chiamata modello. Eseguilo dalla directory degli artifatti degli articoli: Gli otto candidati condividono deliberatamente una plausibile storia di successo: la maggior parte eleva il punteggio obiettivo. Le loro decisioni sono diverse: Candidato Decisione Evidenza decisiva Patch di sicurezza CANARY READY Guadagno accoppiato, nessun regresso protetto, autorizzazione automatica limitata Cambiamento di recupero AWAITING APPROVAL Le prove passano; la superficie richiede una persona Piccola lezione di memoria HOLD NO MATERIAL GAIN Sicuro, ma l'obiettivo di guadagno è solo 0.01 Genitore stale BLOCKED IDENTITY Il candidato è stato generato dalla base attiva sbagliata. Scrittore di valutazione BLOCKED PROTECTED SURFACE Il candidato può cambiare il governante. Casi privati freschi BLOCKED EVIDENCE Il candidato non ha usato l'insieme bloccato Vincitore aggregato BLOCKED REGRESSION L'integrità dell'effetto strumento è diminuita da 0.03 Manca la vecchia versione BLOCKED ROLLBACK Non è disponibile un artefatto ribaltante denominato. Il risultato utile non è un punteggio di sicurezza composto. Un genitore obsoleto ha bisogno di una rigenerazione. Una regressione protetta richiede una diagnosi. Un bersaglio mancante deve essere restaurato. Avergiare i fallimenti nasconderebbe la proprietà. Canary il cambiamento, non la tua fiducia Passare i cancelli offline rende un candidato idoneo a un canario; non dimostra la salute della produzione. Limita i compiti, il tempo, le spese, gli strumenti e gli effetti collaterali. Tenete il genitore disponibile. Il canario di rotta funziona solo il cui risultato può essere verificato in modo indipendente. Confronta le sue entrate in diretta con una linea di riferimento parent contemporanea o recente, se il carico di lavoro lo consente. Definire i trigger di rolloff prima dell'attivazione: violazione della metrica protetta, tasso di risultato sconosciuto, effetti duplicati, omissioni di omologazioni, massimale di spesa o insufficienza della freschezza di prova. Rollback significa ripristinare l'artefatto genitore esatto e verificare che il risultato della missione prevista ritorni. Un comando di ritorno che si è completato è attività, non recupero. Conserva tre registri dopo il canario: il candidato immutabile e i digesti genitori; le prove in coppia offline e canarie, compresi i segnali non disponibili; la decisione di promozione, di sospensione, di approvazione o di rimozione con la ricevuta dell'autorità. Se le prove scompaiono, restituire UNCERTAIN e interrompere la promozione. Non convertire una misura assente in un valore sano. Se la stessa proposta fallisce ripetutamente, il limite di tempo viene riprovato e indirizzato a una persona piuttosto che lasciare che il ciclo di miglioramento consuma tempo e token illimitati. Sappi cosa non può dimostrare questa porta. L'audit fornito verifica la forma manifesta, la priorità, i delta metrici accoppiati, l'ambito di competenza e la risoluzione del rollback. Non dimostra che la tua sospensione rappresenti la produzione, che una rubrica umana sia corretta, o che un raro fallimento apparirà in 20 compiti canari. I test possono diventare obsoleti. I valutatori possono condividere i punti ciechi del modello. Gli strumenti esterni possono cambiare dopo il passaggio del candidato. Il default pratico è quindi limitato: automatizzare liberamente la generazione di candidati, automatizzare attentamente la valutazione a basso rischio e automatizzare l'attivazione solo all'interno di un quadro esplicito di autorità. Tenere le superfici ad alto impatto e irreversibili approvate dall'uomo. Continuare a monitorare dopo la promozione, perché un agente che si auto migliora è sano solo quando i suoi risultati utili rimangono saninon quando la sua pipeline di aggiornamento è occupata. Sidewisp è attualmente in anteprima privata. La sua direzione è quella di aggiungere uno strato di salute intorno ai tempi di esecuzione degli agenti esistenti, con prove, confini di approvazione e verifica dei risultati; gli adattatori di monitoraggio della produzione e i sistemi di recupero non vengono generalmente spediti. Se quel confine corrisponde al modo in cui gestisci gli agenti, puoi Partecipa alla visualizzazione privata.