2026-08-01T14:17:49.851Z

LLM Auto-valutazione: Calibra il giudice prima di fidarti di esso

Convertire ogni verdetto a prove deterministe, un giudice LLM calibrato specifico per criteri, o una revisione umana responsabile.

L'autovalutazione di LLM è utile quando il criterio è veramente qualitativo, l'evaluatore è stato testato con le etichette umane per tale criterio esatto e la sua risposta è trattata come prova di sostegno. Non dovrebbe decidere se esiste un fascicolo, un pagamento effettuato, un test superato o se una persona ha autorizzato un'azione irreversibile. Queste domande hanno già proprietari più forti: controlli deterministici o umani responsabili. Il default pratico è quindi un router, non un giudice universale. Invia le richieste meccanicamente verificabili al codice. Inviare criteri qualitativi limitati a un valutatore calibrato del modello. Inviare a una persona decisioni sconosciute, instabili o di grande impatto. Se mancano le prove, tenete il verdetto unknown . Un giudice LLM può essere utile senza essere autorizzato L'autovalutazione significa chiedere a un LLM di valutare la propria produzione o la produzione di un altro modello. Un secondo passaggio può catturare un'ovvia contraddizione, confrontare due riassunti o classificare una risposta rispetto a una rubrica. Scopri l'insieme di Prompting mostra il modello di base: generare una risposta, quindi chiedere a un modello di criticarla o rivedere. La ricerca dà a questo modello un ruolo credibile ma limitato. Ren e colleghi ha riformulato l'auto valutazione aperta come previsioni a livello di token e ha riportato una migliore precisione di generazione selettiva e una correlazione più forte con la qualità di uscita su TruthfulQA e TL;DR per le loro impostazioni testate PaLM 2 e GPT 3. Uno studio più recente sui compiti a più fasi ha rilevato che auto valutazione graduale ha superato il punteggio olistico per il rilevamento dei guasti su due set di dati di riferimento, con un aumento relativo fino al 15% dell'AUC ROC. Nessun risultato trasforma un modello di parere in ricevuta di consegna. Essi dimostrano che l'auto valutazione può migliorare una decisione in base a specifici compiti, richieste, modelli e set di dati. L'unità di fiducia è quella configurazione del valutatore testata, non la frase "LLM giudice". Esistono anche le modalità di fallimento note. Il giornale MT Bench e Chatbot Arena riferisce che i giudici forti hanno raggiunto più dell'80% di accordo con le preferenze umane nel suo ambiente, documentando posizione, verbosità, auto aumento e pregiudizi di ragionamento. L'accordo è incoraggiante; l'elenco dei pregiudizi è operativamente decisivo. Un giudice può essere utile in media e comunque invertire l'unico verdetto che conta. Il pregiudizio di posizione è facile da testare. Valutare i candidati A e B, scambiare il loro ordine senza cambiare il loro contenuto, e valutare di nuovo. Wang e colleghi ha dimostrato che i cambiamenti di ordine potrebbero modificare in modo significativo le classifiche in coppia e ha proposto la calibrazione di posizione equilibrata più l'escalation umana. Se il candidato preferito cambia dopo lo scambio, registrare unstable . Non proporre la contraddizione in un punteggio sicuro. Fermare il criterio prima di calibrare il giudice "Qualità" è troppo ampia per essere calibrata. Un giudice che riconosce un chiaro riassunto può ancora non essere affidabile per quanto riguarda la base dei fatti, l'interpretazione delle politiche o la sufficienza delle prove. Definire un criterio con un contratto stretto: Il set di calibrazione ha bisogno di esempi che l'evaluatore non ha scritto, di etichette dalle persone che possiedono il criterio e di negativi abbastanza difficili da esporre una valutazione lusinghiera o eccessivamente permissiva. Congelare l'identificatore del modello, il prompt di giudizio, la rubrica, gli esempi, il parser di uscita e la soglia insieme. Una modifica di una di esse crea una nuova versione di valutazione. Le etichette umane non sono un imbarazzo in questo processo; definiscono l'obiettivo. Gli autori di EvalGen descrive la "drift dei criteri": le persone spesso perfezionano ciò che intendono con un criterio dopo aver visto risultati reali. Questo è un motivo per i criteri di versione e le etichette, non un motivo per nascondere il giudizio dietro un punteggio del modello. Misurare almeno queste proprietà per criterio: l'accordo contro le etichette umane protette; il tasso di passaggio falso, perché un valutatore che approva un risultato negativo crea un falso successo; il tasso unknown , che rivela la copertura mancante; la stabilità quando l'ordine candidato e il formato non sono cambiati in modo rilevante; copertura per lingua, famiglia di attività, classe di impatto e lunghezza di uscita; cluster di disaccordi, conservati come esempi per la prossima revisione. Non combinare criteri non correlati in una media rassicurante. Supponiamo che la chiarezza abbia un accordo al 100%, la fondatezza abbia il 75% e la sicurezza abbia solo due esempi etichettati. Un punteggio misto dell'88% può nascondere che non esiste un portale di sicurezza difendibile. Tenete le tre file separate. Le soglie sono scelte politiche, non costanti di un documento. Un team può accettare l'80% di accordo per un suggerimento di stile a basso impatto e richiedere una prova deterministica per un effetto di distribuzione. La proprietà importante è che la soglia è congelata prima che il candidato di rilascio sia segnato. Riproduci un cancello di calibrazione Il seguente sistema utilizza quattro criteri e otto casi di routing. La sua soglia è deliberatamente semplice: almeno tre esempi etichettati dall'uomo, almeno un accordo dell'80% e nessun cambiamento vincitore nell'inversione dell'ordine. La regola decisionale è piccola: Eseguire l' apparecchio completo con: Il replay produce: Due osservazioni sono più importanti dei numeri compatti. Innanzitutto, il dispositivo contiene un documento mancante che il giudice chiama pass . Il router restituisce deterministico fail . Contiene anche una somma di controllo che non piace al giudice; il router restituisce deterministica pass . Un modello può commentare la presentazione, ma non riesce ad annullare le prove sul fatto che l'oggetto promesso esista e corrisponda. In secondo luogo, la qualità in coppia ha un accordo perfetto su quattro esempi etichettati ma cambia il suo vincitore quando i candidati scambiano ordine. Il cancello non funziona. L'accordo storico non giustifica una contraddizione attuale. Questa piccola riproduzione non è la prova che l'80% sia sicuro per la tua applicazione. E' un modello verificabile per dimostrare che ogni verdetto ha raggiunto il proprietario corretto delle prove. Inviare la decisione dal vivo al proprietario delle prove più forti Una volta superata la calibrazione, la decisione di tempo di esecuzione dovrebbe conservare tre corsie. Deterministic lane. Utilizzare i controlli del file system, la convalida dello schema, i risultati dei test, i vincoli del database, le ricevute del fornitore, le firme, le somme di controllo e le letture di destinazione quando possono rispondere direttamente alla domanda. Registrare il valore osservato e la freschezza. Un comando che esce da zero dimostra solo il contratto di tale comando; verificare separatamente il risultato esterno previsto. Linea di supporto giudiziario. Utilizzare un valutatore fissato per criteri quali chiarezza, pertinenza, tono o aderenza alla rubrica quando la copertura di calibrazione corrisponde al caso corrente. Ritenere il criterio, la versione dell'evaluatore, l'hash prompt, il riferimento di input, il verdetto, la spiegazione e la versione di set di calibrazione. Il modello sostiene il verdetto; la politica circostante decide ciò che le prove consentono. Linea di revisione umana. Route Disordini di alto impatto, nuove lingue, famiglie di attività non rilevate, instabilità dell'ordine, eccezioni politiche e autorità irreversibili qui. Includere le prove contrastanti e una domanda concreta. "Per favore, rivedere" è un errore debole; "La ricevuta deterministica è mancante mentre il giudice dice completopotrà chiudere questo incidente?" è applicabile. Un risultato unknown è utile. Dice che il sistema non può attualmente stabilire la richiesta. Trasformare l'ignoto in passaggio protegge semplicemente la scheda da sembrare incompleta. Ricalibrare sulla deriva, non solo su un calendario Un giudice può derivare quando il nome del modello cambia, il prompt viene modificato, gli esempi vengono riordinati, arriva una nuova lingua, le uscite diventano più lunghe o il prodotto inizia a gestire una famiglia di attività diversa. Ricalibrazione di tali cambiamenti e monitoraggio dei campioni di disaccordi in diretta tra le revisioni programmate. Tenere visibili due confini: 1. L'autovalutazione stima una proprietà qualitativa limitata; non dimostra la raggiungibilità, il progresso utile, gli effetti degli strumenti, la persistenza della memoria o l'esistenza di consegna. 2. Un valutatore calibrato riduce il carico di revisione; non riceve autorità umana su segreti, spese, pubblicazione, cancellazione o altre azioni irreversibili. Il risultato è una forma meno teatrale di valutazione AI. Il giudice ottiene un lavoro utile, la prova deterministica mantiene il suo lavoro più forte, e la gente conserva le decisioni che le appartengono. Sidewisp è attualmente in anteprima privata. Si sta sviluppando come uno strato di salute intorno ai tempi di esecuzione degli agenti esistenti, ma la raccolta e il recupero dell'agente di produzione e della salute non vengono spediti nel repository attuale del sito web. Se questo problema di routing delle prove corrisponde al modo in cui si gestiscono gli agenti, si può unirsi alla lista di attesa di anteprima privata senza trattare l'articolo come una richiesta di un'integrazione di monitoraggio dal vivo.