2026-08-01T09:30:59.386Z
MLflow LLM Avaliação: Adicionar um portão de liberação de tempo de execução-saúde
Reproduzir o caminho de avaliação do MLflow, depois adicionar quatro recibos de tempo de execução para que uma pontuação de passagem não se torne um veredicto de agente falso-verde.
A avaliação MLflow LLM pode indicar se os resultados de uma aplicação satisfazem os critérios escolhidos. Não pode, por si só, provar que o agente foi acessível, iniciado a tempo, completou um efeito colateral externo ou deixou o produto prometido no seu destino. O padrão prático é manter o resultado da avaliação do fluxo de ML e o veredicto de saúde no tempo de execução como duas camadas de evidências, e, em seguida, exigir ambos antes da liberação. Testei esse limite com o MLflow 3.14.0. Um marcador baseado em código deu a três agentes uma corrida perfeita exact deliverable/mean de 1.0 . Uma regra de saúde separada de quatro recibos permitiu apenas uma dessas corridas passar. A diferença não foi uma falha no fluxo de ML. Foi um desajuste entre a pergunta que o marcador respondeu e a decisão operacional mais ampla. Reproduzir o caminho documentado de avaliação do fluxo de ML A Manual de avaliação atual do MLflow define uma avaliação a partir de três componentes: um conjunto de dados, um ou mais marcadores e uma função de previsão opcional. O conjunto de dados fornece entradas e expectativas. Uma função de previsão gera saídas quando elas não estão já presentes. Os marcadores transformam as evidências disponíveis em feedback ou métricas. Essa divisão é útil porque torna explícita a questão de avaliação. Se a questão for Este resultado é igual ao nome esperado de entrega?, um marcador baseado em código determinista é mais adequado do que um juiz LLM. MLflows Documentação de pontuação personalizada permite que os marcadores vejam inputs , outputs , expectations ou um rastro completo, e retornem um resultado primitivo ou mais rico Feedback . O experimento usou uma lista de linhas, saídas pré geradas e este marcador: O MLflow registrou o exact deliverable/mean = 1.0 . Esse é o resultado correto para a evidência definida: cada cadeia de saída correspondeu à sua expectativa. O resultado é reprodutivo, barato e fácil de explicar. Também é mais estreita do que Todas as três corridas de agentes são saudáveis. MLflows Documentação do conjunto de dados de avaliação descreve conjuntos de dados como exemplos selecionados para prevenção de regressão, comparação de versões e testes de qualidade direcionados. Esse é o modelo mental certo. Um conjunto de dados é um conjunto de testes para as alegações codificadas em seus exemplos e marcadores; não é automaticamente um censo de cada falha de produção que importa. Colocar as receitas operacionais ao lado do resultado da avaliação O mesmo dispositivo anexou um pequeno recibo de execução a cada tarefa. A Comissão registou quatro fatos que o marcador de resultados exatos não verificou: heartbeatFresh : o tempo de execução é alcançável recentemente; scheduleOnTime : a corrida prevista iniciada dentro da sua janela permitida; effectVerified : o destino externo confirma o efeito colateral previsto; deliverableVerified : o artefato prometido existe e passa a verificação de destino. A comparação resultante foi: Tarefa Exatamente entregue Evidências de tempo de execução Decisão de liberação run 101 Passagem Todos os quatro recibos presentes libertação run 102 Passagem batimentos cardíacos obsoletos; efeito e entregabilidade não verificados bloqueio como inacessível run 103 Passagem O horário perdeu a janela permitida. Bloco tão tarde Passaram as três filas de avaliação. Apenas uma corrida era soltável. Uma corda correta pode sobreviver numa resposta em cache depois que um trabalhador desaparece. Uma carga útil correta pode chegar após o prazo de funcionamento. Uma chamada de ferramenta pode devolver uma confirmação plausível enquanto o destino permanece inalterado. Nenhum desses casos invalida o marcador de saída; eles demonstram por que a decisão de libertação necessita de provas adicionais. Mantenha as camadas unidas por um task id ou run id estável, mas não as desmorone em uma pontuação vaga. Um disco compacto pode parecer assim: A união é importante. Sem ele, uma equipe pode comparar um recibo de saúde atual com uma avaliação de outra versão, ambiente ou retestar. Incluir a versão do aplicativo, a versão do conjunto de dados, a versão de pontuação, o ambiente e o tempo de observação quando essas dimensões podem mudar o veredicto. O MLflow pode conservar as avaliações e rastrear as evidências; o tempo de execução ou o destino deve ainda fornecer factos que apenas ele pode conhecer. Tratar as provas faltantes como unknown , não como pass . Uma falta de batimento cardíaco pode significar falha do coletor em vez de falha do agente. Um recibo de destino faltante pode significar que a inscrição falhou, que o verificador falhou ou que a integração não pode revelar o facto. Estes Estados pedem uma investigação; não justificam uma liberação verde. Use uma decisão de dois portões em vez de uma pontuação mista Uma regra prática de libertação é deliberadamente chata: Cada cláusula deve manter a sua própria evidência, frescura e razão de falha. Isso dá a um operador uma ação próxima limitada: Uma falha de avaliação retorna ao prompt, modelo, política de ferramenta, conjunto de dados ou marcador. Um batimento cardíaco obsoleto vai até ao diagnóstico de corrida ou colecionador. Uma rota de cronograma perdida para o cronógrafo, fila ou limite de capacidade. Um efeito não verificado bloqueia as reincidências até que o destino externo seja reconciliado. Uma rota de entrega faltante para o verificador do produtor ou do destino. Esta separação impede também que um juiz da LLM se torne uma autoridade para a qual não foi concebido. Os juízes são valiosos quando a correcção ou a qualidade exigem uma avaliação semântica. O MLflow suporta explicitamente os marcadores integrados, baseados em diretrizes, personalizados e baseados em código. Use essas ferramentas para os critérios estabelecidos. Preferir verificações deterministas de destino para a existência de arquivos, estado de banco de dados, recursos da API, resultados de testes ou recibos assinados. Não leia o experimento, já que MLflow não tem monitorização da produção. Avaliação de documentos de MLflow, rastreamento, monitorização, conjuntos de dados, feedback e vários tipos de marcadores. A conclusão mais estreita é falsificável: a avaliação exata efectuada aqui não estabeleceu quatro fatos operacionais porque os seus dados e o seu punteiro não os testaram. Pode adicionar marcadores orientados para a saúde quando as provas relevantes estiverem presentes, ou manter o classificador de saúde ao lado do MLflow quando as provas estiverem presentes nos sistemas externos. O aparelho é intencionalmente pequeno. Não faz referência aos juízes LLM, não testa o fluxo MLflow em escala, não compara fornecedores nem mede a cobertura de monitoramento. O seu valor é o desajuste controlado: três passos de avaliação idênticos, três estados operacionais diferentes e uma regra inspecionável que explica a decisão de libertação. Para os agentes operacionais das equipes, este limite é útil: avaliar a qualidade da saída com o marcador apropriado mais forte, verificar os fatos operacionais na sua fonte e unir as evidências antes de declarar o sucesso. A Sidewisp está atualmente em prévia privada. O seu papel planejado é uma camada de saúde ao lado dos tempos de execução existentes, e não um substituto do MLflow ou uma afirmação automática de que uma avaliação aprovada significa um agente saudável. A experiência pública atual é um local de acesso precoce e uma demonstração de produtos; os adaptadores de monitorização da produção geralmente não são enviados.