2026-08-01T09:31:01.638Z

MLflow LLM Evaluazione: Aggiungi un cancello di rilascio Runtime-Health

Riproduci il percorso di valutazione di MLflow, poi aggiungi quattro ricevute di runtime in modo che un punteggio di passaggio non diventi un verdetto agente falso-verde.

La valutazione MLflow LLM può dirti se i risultati di un'applicazione soddisfano i criteri scelti. Non può, da sola, dimostrare che l'agente è stato raggiungibile, avviato in tempo, completato un effetto collaterale esterno o ha lasciato il prodotto promesso alla destinazione. Il default pratico consiste nel mantenere il risultato di valutazione del flusso ML e il verdetto sulla salute durante il periodo di esecuzione come due strati di prova, quindi richiedere entrambi prima di rilasciare. Ho testato quel limite con MLflow 3.14.0. Un punteggiatore basato su codice ha dato tre agenti una corsa perfetta exact deliverable/mean di 1.0 . Una regola sanitaria separata di quattro ricevute ha permesso di passare solo una di quelle gare. La differenza non è stata un difetto nel flussore ML. Si trattava di una discrepanza tra la domanda risposta dal segnador e la decisione operativa più ampia. Riproduce il percorso di valutazione del flussore ML documentato L'attuale guida di valutazione di MLflow definisce una valutazione da tre componenti: un set di dati, uno o più punteggiatori e una funzione di previsione opzionale. Il set di dati fornisce input e aspettative. Una funzione di previsione genera output quando non sono già presenti. I punteggiatori trasformano le prove disponibili in feedback o metriche. Tale divisione è utile perché rende esplicita la domanda di valutazione. Se la domanda è Questo output è uguale al nome di consegna atteso?, un punteggiatore deterministico basato su codice è più appropriato di un giudice LLM. Il MLflows Documentazione personalizzata per i punteggiatori consente ai marcatori di leggere inputs , outputs , expectations , o una traccia completa, e di restituire un risultato primitivo o più ricco Feedback . L'esperimento ha usato un elenco in linea, uscite pre generate, e questo punteggiatore: MLflow ha registrato exact deliverable/mean = 1.0 . Questo è il risultato corretto per le prove definite: ogni stringa di uscita corrispondeva alle sue aspettative. Il risultato è riproducibile, economico e facile da spiegare. E' anche più ristretto di Tutti i tre agenti correnti sono sani. MLflows documentazione del set di dati di valutazione descrive i set di dati come esempi selezionati per la prevenzione della regressione, il confronto delle versioni e i test di qualità mirati. Questo è il giusto modello mentale. Un set di dati è una suite di test per le affermazioni codificate nei suoi esempi e nei suoi punteggi; non è automaticamente un censimento di ogni fallimento di produzione che conta. Mettere le ricevute operative accanto al risultato della valutazione Lo stesso apparecchio attaccava una piccola ricevuta di tempo di esecuzione a ciascun compito. Ha registrato quattro fatti che il punteggiatore esatto non ha esaminato: heartbeatFresh : il tempo di esecuzione è raggiungibile recentemente; scheduleOnTime : la corsa prevista è iniziata entro la finestra consentita; effectVerified : la destinazione esterna conferma l'effetto collaterale previsto; deliverableVerified : l'artefatto promesso esiste e passa il controllo di destinazione. Il risultato è stato il seguente: Compito Esatto consegnabile Evidenza del tempo di esecuzione Decisione di rilascio run 101 passaggio tutte e quattro le ricevute presenti rilascio run 102 passaggio battito cardiaco stagnato; effetto e consegna non verificati blocco non raggiungibile run 103 passaggio programma ha perso la finestra consentita blocco come tardi Sono passate tutte e tre le righe di valutazione. Solo una corsa era liberabile. Una stringa corretta può sopravvivere in una risposta memorizzata dopo che un lavoratore scompare. Un carico utile corretto può arrivare dopo la scadenza di lavoro. Una chiamata per lo strumento può restituire un riconoscimento plausibile mentre la destinazione rimane invariata. Nessun di questi casi invalida il punteggiatore di output; dimostrano perché la decisione di rilascio richiede prove aggiuntive. Mantenere gli strati uniti da una task id stabile o run id , ma non farli crollare in un solo punteggio vago. Un disco compatto può sembrare così: La chiave di unire e' importante. Senza di essa, un team può confrontare una ricevuta di salute corrente con una valutazione da un'altra versione, ambiente o riprovare. Includere la versione dell'applicazione, la versione del set di dati, la versione di punteggio, l'ambiente e il tempo di osservazione quando queste dimensioni possono cambiare il verdetto. MLflow può conservare la valutazione e tracciare le prove; il tempo di esecuzione o la destinazione devono comunque fornire dati che solo essa può conoscere. Trattare le prove mancanti come unknown , non come pass . Un battito cardiaco mancante può significare un fallimento del collettore piuttosto che un fallimento dell'agente. Una ricevuta di destinazione mancante può significare che la registrazione non è riuscita, che il verificatore non è riuscito o che l'integrazione non può rivelare il fatto. Questi Stati chiedono un'indagine; non giustificano un rilascio verde. Utilizzare una decisione a due porte invece di un punteggio misto Una regola pratica di rilascio è deliberatamente noiosa: Ogni clausola dovrebbe conservare le sue prove, la sua freschezza e la sua ragione di fallimento. Questo dà all'operatore una prossima azione limitata: Un fallimento di valutazione ritorna al prompt, al modello, alla politica degli strumenti, all'insieme di dati o al punteggiatore. Un battito cardiaco stagnato conduce alla diagnosi runtime o collettiva. Un percorso di programmazione mancato per il programmatore, la coda o il limite di capacità. Un effetto non verificato blocca i ripeti tentativi fino a quando la destinazione esterna non è riconciliata. Un percorso di consegna mancante al produttore o al verificatore di destinazione. Questa separazione impedisce inoltre a un giudice LLM di diventare un'autorità che non era progettato per essere. I giudici sono preziosi quando la correttezza o la qualità richiedono una valutazione semantica. MLflow supporta esplicitamente i punteggiatori integrati, basati su linee guida, personalizzati e basati su codice. Utilizzare questi strumenti per i loro criteri indicati. Preferire controlli deterministici di destinazione per l'esistenza di file, lo stato del database, le risorse API, i risultati dei test o le ricevute firmate. Non leggere l'esperimento in quanto MLflow manca di monitoraggio della produzione. Evaluare i documenti di MLflow, tracciare, monitorare, set di dati, feedback e diversi tipi di punteggiatori. La conclusione più restrittiva è falsificabile: l'esatta valutazione effettuata qui non ha stabilito quattro fatti operativi perché i suoi dati e il punteggiatore non li hanno testati. È possibile aggiungere punteggi orientati alla salute quando le prove pertinenti sono presenti, o mantenere il classificatore di salute accanto a MLflow quando le prove vivono nel runtime e nei sistemi esterni. Il dispositivo è intenzionalmente piccolo. L'elemento non fa riferimento ai giudici LLM, non testano il flusso MLflow su scala, non confronta i fornitori o non misura la copertura del monitoraggio. Il suo valore è la discrepanza controllata: tre passaggi di valutazione identici, tre stati operativi diversi e una regola ispezionabile che spiega la decisione di rilascio. Per gli agenti che operano nelle squadre, questo limite è utile: valutare la qualità dell'output con il punteggio più forte appropriato, verificare i fatti operativi alla loro fonte e unire le prove prima di dichiarare il successo. Sidewisp è attualmente in anteprima privata. Il suo ruolo previsto è uno strato di salute insieme ai tempi di esecuzione esistenti, non un sostituto di MLflow o un'affermazione automatica che una valutazione passata significhi un agente sano. L'attuale esperienza pubblica è un sito di accesso precoce e una dimostrazione dei prodotti; gli adattatori di monitoraggio della produzione non vengono generalmente spediti.