2026-08-01T13:20:01.259Z

Modelli di progettazione degli agenti AI: scegliere in base al contenimento del guasto

Scegliere la topologia dell'agente meno complessa per gli stati di fallimento che crea, quindi richiedere ricevute per fasi, rami, consegne, loop e risultati.

I modelli di progettazione dell'agente AI devono essere scelti secondo il limite di guasto che è possibile operare. Inizia con una chiamata di modello diretta o un agente con gli strumenti. Aggiungere fasi sequenziali, rami paralleli, consegne specializzate o un ciclo di revisione solo quando un requisito di carico di lavoro misurato giustifica la nuova topologiae solo quando si possono registrare le prove di cui la topologia ha bisogno. Questa risposta e' meno affascinante che attirare una flotta di agenti che collaborano. È anche più facile debuggare, più economico eseguire e più difficile confondere con un sistema sano quando parte del lavoro è scomparsa. La regola centrale è semplice: Ogni nuova esecuzione crea un debito di prova. Non aggiungere il bordo fino a quando non riesci a nominare il suo stato falso verde e la ricevuta che lo nega. Questo articolo applica tale regola a sei scelte comuni: una chiamata di modello diretta, un singolo agente, una pipeline sequenziale, un ventilatore parallelo, una consegna specializzata e un ciclo di revisione limitato. Include un selettore deterministico riprodotto contro sei carichi di lavoro. Inizia al di sotto di agent a meno che il compito non guadagni autonomia Un diagramma di architettura dovrebbe iniziare con il meccanismo meno potente che possa soddisfare il contratto di attività. Una classificazione o una traduzione in un solo passo non richiede di solito né strumenti né un ciclo di agente. La questione sanitaria è semplicemente se la produzione soddisfa un'affermazione definita. Un singolo agente diventa utile quando il compito è abbastanza aperto da richiedere diverse decisioni o richieste di strumenti. Un agente di supporto degli ordini, ad esempio, può interpretare una richiesta, recuperare un ordine e comporre una risposta. Ha ancora un proprietario e un posto per verificare il risultato. Ciò è coerente con le attuali linee guida ufficiali. Guida dei modelli degli agenti di Google Cloud dice di definire la complessità del compito, la latenza, il costo e i requisiti di coinvolgimento umano prima di selezionare un modello. Si raccomanda di iniziare con un agente durante il primo sviluppo e osserva che i progetti multi agenti aggiungono valutazioni, sicurezza, affidabilità e problemi di costo. La Centro di architettura Azure raccomanda in modo simile la più bassa complessità che soddisfi in modo affidabile i requisiti; richiede modalità di overhead di coordinamento, latenza e guasti aggiuntivi nei sistemi multi agenti. Utilizzare questo primo limite decisionale: Proprietà di carico di lavoro Ragionevole inadempimento Prove di completamento Una trasformazione limitata, nessun strumento. Chiamazione di modello diretta L'uscita supera l'affermazione del compito Diverse decisioni all'interno di un unico dominio Agente unico con strumenti Sono verificati gli effetti degli strumenti richiesti e il risultato finale Stagi fissi con strette dipendenze Pipeline sequenziale Ogni fase consumava la versione predecessore attesa Subtasche indipendenti la cui latenza è importante Ventilatore parallelo Ogni ramo richiesto viene contabilizzato prima dell'aggregazione Routing dinamico tra domini o autorità distinte Trasferimento specializzato Un ricevitore ha accettato la proprietà e può riprendere da un cursore duraturo La revisione deve proseguire fino a quando una condizione misurabile non si è mantenuta Circolo di circolazione Il progresso è cambiato, il verificatore è passato e il budget di iterazione è stato mantenuto Il tavolo è di default, non un disegno automatico. Una chiamata diretta può comunque essere pericolosa se la sua uscita innesca un'azione irreversibile. Un singolo agente può essere ancora troppo ampio se ha decine di strumenti con autorizzazioni incompatibili. Il modello segue il carico di lavoro e il confine dell'autorità. L'importante ostacolo è quello di evitare di considerare la decomposizione come affidabilità libera. Dividere un compito tra più componenti può migliorare la specializzazione, la latenza o l'isolamento della sicurezza. Crea anche stati parziali. L'operatore deve essere in grado di distinguere quale stato occupa la corsa senza leggere un messaggio finale convincente. Facciamo pagare ogni topologia il debito di prova Guida prescrizionale AWS descrive i modelli degli agenti come blocchi di costruzione riutilizzabili e compostabili. Il riutilizzo è prezioso, ma la composizione cambia il significato di done. Una componente di reporting di successo è solo la prova dell'attività. La domanda utile è se l'intera topologia abbia prodotto il risultato previsto. Sequenziale: dimostrare la catena, non l'ultima fase Un modello sequenziale è appropriato quando l'ordine delle fasi fa parte della correttezza: estrarre, convalidare, approvare e poi pubblicare. Il caso falso verde appare quando una fase successiva viene eseguita dopo che una fase precedente non è riuscita, si utilizza un'uscita obsoleta o si produce una versione incompatibile. Inserire ad ogni fase una ricevuta contenente almeno: l'ID di esecuzione e l'ID di fase; il ricevimento o l'hash di input del predecessore; il hash di uscita o l'ID dell'effetto duraturo; stato terminale e tempo di completamento; l'affermazione che consente la prossima fase. La fase successiva dovrebbe respingere un predecessore mancante o non corrispondente piuttosto che indovinare. Un evento finale pubblicato completato non può riparare una ricevuta di convalida assente. Parallelamente: congelare l'adesione prima di completare il conteggio La diffusione parallela è giustificata quando le filiali indipendenti riducono la latenza o raccolgono prove distinte. Il suo caratteristico fallimento è un collettore che restituisce una risposta lucidata mentre un ramo richiesto è assente, duplicato, in ritardo o basato su input obsoleti. Congelare un manifesto di ramo prima di spedire. Marcare i rami necessari o facoltativi. Quindi definire un quorum sul manifesto congelato, non su quali risposte arrivano. Il collezionista ha bisogno di identità di ramo, versione di input, stato terminale, identità di effetto e freschezza. Tre risposte ricevute non sono sufficienti se sono state richieste quattro. Trasferimento: proprietà di trasferimento, non semplicemente contesto Una consegna specializzata è utile quando il prossimo agente ha bisogno di un dominio, di un set di strumenti o di un limite di autorizzazione diverso. Falle in silenzio quando il mittente riferisce trasferito ma il destinatario non ha mai accettato il lavoroo accettato senza lo stato richiesto per continuare. Una trasmissione duratura ha bisogno di due lati: 1. il mittente registra il ricevitore previsto, l'ID di lavoro, la versione di contesto e il risultato rimanente; 2. il ricevitore registra l'accettazione, l'epoca di proprietà e un cursore di curriculum. Finché non esiste l'accettazione, il lavoro aspetta con il mittente. Dopo l'accettazione, solo il destinatario può effettuare l'effetto successivo. Ciò impedisce un divario ambiguo e riduce il duplicato di lavoro dopo i ripeti tentativi. Loop: progresso del bilancio, non solo iterazioni Un generatore critico o un ciclo di riparazione verificazione è appropriato quando la qualità migliora attraverso una valutazione ripetuta. Non è appropriato solo perché il primo risultato potrebbe essere debole. Il circuito deve avere un segnale di progresso misurabile, un verificatore e una condizione di arresto. Registrazione: numero di iterazioni e massimo; termine e costi rimanenti; le impronte digitali di ingresso e di uscita; un delta di progresso specifico per dominio; risultato del verificatore; ragione per continuare, fermarsi o aumentare. Un ciclo che ripete una formulazione diversa senza cambiare test, vincoli o l'artefatto atteso è attivo ma non progredisce. Fermalo prima che consuma il bilancio finale necessario per preservare le prove, ritirare o chiedere a una persona. Riproduci una regola di selezione prima di adottare il diagramma Ho convertito i confini precedenti in un piccolo selettore deterministico. Preferisce deliberatamente modelli più semplici. La priorità è esplicita in modo che un carico di lavoro che necessita di un verificatore iterativo non ricada accidentalmente nella categoria sequenziale semplicemente perché i suoi passi hanno un ordine. L'artefatto completo utilizza pattern cases.json , select agent pattern.mjs e un rapporto atteso. Fate partire con: La riproduzione di sei casi ha prodotto la parità prevista esatta: Carico di lavoro Modello selezionato Risultato richiesto Classificare un messaggio Chiamazione di modello diretta Asserzione di input/output Cerca un ordine e rispondi . Agente unico Manifesto di esecuzione, ricevute di effetto strumento, affermazione del risultato Estratto, revisione, pubblicazione Sequenziale Catena di ricevimento di fase, versione di input, stato di arresto Ricerca su quattro fonti indipendenti Ventilatore parallelo Manifesto della branca congelata, quorum richiesto, affermazione aggregata Assistenza di percorso per uno specialista Trasferimento specializzato Conto di proprietà, cursore di ripresa, affermazione finale Rivedi il codice fino al passaggio delle prove Circolo di circolazione Budget di iterazione, progress delta, verdetto del verificatore Tutte le sei raccomandazioni corrispondevano e tutte e sei emettevano un obbligo di prova distinto. Questo secondo risultato è più importante che l'accuratezza del selezionatore. Un nome di modello senza il contratto di ricezione è una preferenza di progettazione, non una decisione operativa. Tre osservazioni sono emerse dal replay. In primo luogo, la topologia dell'ambiguità mappa all'ambiguità della prova. Le fasi sequenziali creano ambiguità di completamento parziale; i rami paralleli creano ambiguità di appartenenza; le consegne creano ambiguità di proprietà; i loop creano ambiguità di terminazione. In secondo luogo, la stessa affermazione del risultato finale rimane necessaria in ogni modello. Un manifesto completo della succursale dimostra la contabilità della succursale, non che la relazione riunita abbia risposto alla domanda del cliente. Una ricevuta di consegna prova la proprietà, non la consegna. Un passaggio del verdetto dei critici dimostra solo i criteri che il critico ha effettivamente valutato. In terzo luogo, i trigger migratori sono più affidabili dell'entusiasmo per i modelli. Si allontana da un agente quando le prove mostrano un sovraccarico di strumenti, un limite di sicurezza rigoroso, una latenza indipendente o un fallimento ricorrente che la topologia più semplice non può contenere. Multi agent è più scalabile non è un trigger misurabile. Trattare il modello come un contratto operativo Prima dell'implementazione, scrivere un contratto di una pagina per il modello scelto: IResultato previsto: Quale artefatto o effetto osservabile deve esistere? AAutorità: Quale componente può apportare ogni modifica reversibile o irreversibile? Membro: Quali stadi, filiali o specialisti appartengono a questa corsa? Progresso: Cosa cambia quando un lavoro utile avanza? Aspettare: Quale dipendenza o decisione umana legittimamente interrompe il lavoro? Error: Quali prove separano un errore transitorio da una corsa bloccata? Completamento: Quali controlli deterministici eliminano il lavoro? Budget: Cosa limita il tempo, i ripetizioni, i token e gli effetti collaterali? Successivamente, iniettare il fallimento caratteristico della topologia prima del lancio. Rimuovi una ricevuta in fase sequenziale. Smettere un ramo parallelo richiesto. Ritardare l'accettazione delle consegne. Ritorna un artefatto invariato da un'iterazione di revisione. Il sistema dovrebbe essere bloccato, aspettare o incerto non verde. C'è un limite pratico qui. Il selettore non può stabilire che la descrizione del carico di lavoro sia corretta. Non misura la qualità del modello, la disponibilità dei fornitori o l'affidabilità effettiva di un quadro. Un schema di ricevimento non può dimostrare che la sua attuazione emette eventi veritieri. Convalidare il modello scelto con apparecchiature a forma di produzione, iniezioni di guasto e controlli di risultato a livello di destinazione. La domanda di revisione più sicura non è quindi Qual è il modello di progettazione dell'agente AI migliore? È: Qual è il modello meno complesso che soddisfa questo carico di lavoro, e possiamo provare i suoi nuovi stati parziali senza ispezionare il contenuto privato? Se la risposta e' una chiamata diretta o un agente, tenetela. Se la risposta è una topologia più complessa, rendere le sue ricevute parte del progetto piuttosto che un progetto di monitoraggio successivo. Sidewisp ha lo scopo di aggiungere uno strato di salute intorno ai tempi di esecuzione degli agenti esistenti, con attenzione alla raggiungibilità, ai progressi utili, al contesto, agli strumenti, ai risultati e al costo. Sidewisp è attualmente in anteprima privata. Il suo sito web pubblico e la sua dimostrazione interattiva sono in diretta, ma la raccolta dell'agente di produzione sanità e gli adattatori di runtime non vengono spediti nell'attuale repository del sito web. Se questo approccio basato sulla prima prova corrisponde al modo in cui si desidera operare gli agenti, si può unirsi alla lista di attesa di anteprima privata.