2026-08-01T08:39:03.735Z

Agente Lightning: Desligue todas as atualizações RL antes que cheguem a um agente

Transforma as implementações do Agente Raios, os intervalos, as recompensas, os resultados dos canários, a aprovação e o regresso em um portal apoiado por evidências para cada recurso treinado.

Agente Lightning: Desligue todas as atualizações RL antes que cheguem a um agente
O artigo Agent Lightning: Train ANY AI Agents with Reinforcement Learning responde a uma importante pergunta de engenharia: como um agente existente pode gerar dados de treinamento sem ser reconstruído em torno de um ciclo RL? Não responde à questão de libertação que se segue: quando é que um recurso recém-formado deve ser autorizado a influenciar um fluxo de trabalho real? O padrão seguro é manter cada novo modelo ou recurso como candidato. Promove-o apenas depois de poder juntar-se à atualização para seu pai exato, snapshot de dados, avaliador, tentativas de implantação, cobertura de vestígios, casos protegidos, resultados limitados de canários, aprovação e rollback testado. Uma recompensa maior é uma prova útil, mas não é um veredicto de saúde. Esse limite se encaixa no quadro, em vez de combatê-lo. O Agente Lightning já separa a execução do Agente do algoritmo de aprendizagem. Preserva essa separação como um portão de libertação. O que o Agente Lightning registra e o que esses registos provam O papel apresenta o Agente Lightning como uma forma de desacoplar a execução do agente do treinamento RL. Modela a execução de agentes como um processo de decisão de Markov, converte as trajetórias de agentes em transições de treinamento através de um módulo de atribuição de crédito e relata experimentos sobre texto para SQL, geração aumentada de recuperação e uso de ferramentas matemáticas. A Documentação do projeto atual dá aos operadores substantivos mais concretos: - um Resource é um ativo que o algoritmo pode atualizar, como um modelo ou um modelo de solicitação; - Uma Rollout é uma unidade de trabalho realizada contra um recurso; - Uma Attempt é uma execução dessa implantação, incluindo retemps; - um Span registra um evento ou rastro da execução; - Um Reward é um julgamento numérico associado a um determinado período de implantação; - O LightningStore conecta o Runner, que executa o agente, ao algoritmo, que consome evidências e atualiza recursos. Esta é uma interface de treinamento forte. Não é um recibo completo de libertação. Considere um lançamento eventualmente bem-sucedido que necessitou de quatro tentativas. A recompensa final pode parecer boa, enquanto as tentativas retomadas revelam não-determinismo, dívidas de custo ou uma dependência que falha intermitentemente. Um segundo lançamento pode ter uma grande recompensa, enquanto 31% dos seus períodos esperados estão faltando. Um terceiro pode melhorar a pontuação média da avaliação ao mesmo tempo em que rompe o único caso protegido que impede uma chamada de ferramenta destrutiva. São diferentes falhas: Registo Pergunta útil que ele responde Pergunta que não responde sozinha --- --- --- Lançamento Que tarefa foi tentada? Existia o resultado externo pretendido? Tentação Quantas execuções ocorreram, e como terminaram? O último sucesso foi estável ou apenas sorte? Espanha Que acontecimentos instrumentais foram observados? Os efeitos importantes não instrumentalizados eram corretos? Recompensa Como um juiz nomeado marcou algum comportamento? O comportamento protegido, a privacidade e o retrocesso permaneceram intactos? Atualização de recursos Que modelo ou prompto se tornou disponível? Esse recurso deve tornar-se o padrão? A distinção importa porque a arquitetura oficial permite que o algoritmo aprenda a partir de intervalos e atualize recursos sem que o Corredor se torne uma autoridade de implantação. Isso é uma característica. Não o apague tratando o recurso mais recente como o recurso aprovado. Coloque um recibo em torno da atualização do treinamento Use um único recibo de actualização imutável, montado em três fases. O recibo pode ficar fora do Agente Lightning enquanto armazenar identificadores estáveis que se juntam aos registos da LightningStore. Antes da formação: congelar a identidade e a autoridade Registrar a identificação do recurso candidato, a identificação exata do recurso-mãe, o snapshot de dados de treinamento, o snapshot de dados mantidos, a versão do avaliador, a configuração do algoritmo, a revisão do código e o alcance previsto. Indicar qual ator pode aprovar um canário e qual ator pode tornar o recurso o padrão. O pai deve resolver para um artefato que ainda pode carregar. Como a última atualização não é um alvo de retrocesso quando a aprendizagem contínua produziu três recursos mais novos desde que a instrução foi escrita. Mantenha o avaliador, os casos protegidos, a política de promoção e o histórico de regresso fora da superfície escrita do aluno. Caso contrário, um optimizador pode melhorar sua pontuação aparente alterando a regra em vez do comportamento. Durante a formação: contabilização das tentativas e cobertura das provas Para cada implantação nas janelas de formação e validação admitidas, manter: As famílias exatas dependem do fluxo de trabalho. A invariante é mais importante do que os nomes: declarar quais evidências devem existir antes de analisar o resultado, em seguida, relatar evidências faltantes como indisponíveis. Não converta a ausência num valor saudável. As tentativas merecem o seu próprio contador. Um lançamento com uma tentativa finalizada e catorze falhas silenciosas não é equivalente a um lançamento que terminou uma vez. Decidir um orçamento de retomada antes da formação, distinguir o retomado esperado das retomadas de infraestrutura e manter a razão de cada tentativa. Após a formação: sucesso de aprendizagem separado da admissão operacional Primeiro, comparem candidato e pai em um lugar de espera fechado. Relatar o resultado agregado, mas também definir orçamentos de tolerância zero ou limitados para as famílias de casos protegidos. Em seguida, executar o candidato em um canário que não pode exceder uma tarefa explícita, tempo, ferramenta, custo, e efeitos colaterais limite. O recibo canário deve verificar o destino, não apenas o comando. Se o agente deveria criar um arquivo, consultar o caminho esperado e validar o seu conteúdo. Se é suposto atualizar um bilhete, leia o bilhete de volta. Se o efeito não puder ser verificado deterministicamente, registar o juiz mais fraco ou evidência humana e sua incerteza. Finalmente, teste de retorno. Carregar o pai exato no mesmo ambiente limitado e provar que o roteamento pode voltar a ele. Só um agente humano autorizado ou sujeito a políticas de liberação deve aprovar o próximo passo. Um experimento com quatro candidatos Encodifiquei o portal como uma fixação determinista do Node.js. Cada candidato melhora a pontuação. Diferem apenas em termos de evidências operacionais: O dispositivo avalia sete verificações: 1. O recurso, o modelo-mãe, a imagem instantânea do conjunto de dados e o avaliador são fixados; 2. Cada implantação concluída tem uma cobertura completa do período de tempo esperado; 3. A dívida inesperada de retomada é zero; 4. O candidato bate o seu pai exato no retalho fechado; 5. Não há regressos em casos protegidos; 6. Todas as tarefas limitadas de canaria têm um resultado verificado e não registados efeitos nocivos; 7. O rollback resolve-se e foi testado, e um ator autorizado aprovou o passo. A sua saída é intencionalmente inconveniente: A maior recompensa ganha perdem. Candidato C melhora 0,10 mas quebra três casos protegidos. Candidato B melhora 0,08 mas tem apenas 83 lançamentos completos de 120 e catorze repetições inesperadas. O candidato D melhora 0,07 mas verifica apenas 18 dos 20 resultados canários e não consegue resolver ou testar o seu pai. O candidato A passa todos os sete cheques, mas o seu veredicto é deliberadamente PROMOTE TO BOUNDED CANARY , não safe ou deploy em todos os lugares. A prova de passagem tem um escopo: este pai, estas instantâneas, este avaliador, estes casos protegidos, este canário e esta janela de observação. O artefacto executável e sua saída legível por máquina tornam a tese falsificável. Mude um campo, reinicie-o e inspecione o cheque falhado. A política é rigorosa por conceito, mas os seus limiares podem ser traduzidos para um fluxo de trabalho real, em vez de ocultos em prosa. A aprendizagem contínua requer uma regra de frescura A documentação do Agente Lightning também descreve um modo de aprendizagem online ou contínua. Os corredores podem relatar lançamentos e intervalos oportunistas; o algoritmo pesquisa novas evidências e pode atualizar os recursos quando chegarem dados suficientes. Esse ciclo faz da frescura parte da correcção. Um painel que diz candidato melhorou sem nomear o corte de dados, versão de avaliador, fonte principal e janela canária está apresentando uma conclusão que não pode ser reconstruída. Usar dois indicadores: - O latest candidate resource pode avançar sempre que o algoritmo criar uma atualização; - O approved default resource avança apenas após o recebimento completo da atualização passar. Nunca os alias. Um consumidor que solicite a autorização de inadimplência não deve receber silenciosamente o mais recente candidato. Também define uma regra de evidências obsoletas. Se o avaliador, o contrato de ferramentas, a distribuição de tarefas ou a parente mudar após o gate ser executado, anule os controlos afetados. Um canário anterior não cobre automaticamente uma nova autorização, destino, modelo de servidor ou política de retest. Para o treinamento de longa duração, as condições de parada pertencem ao lado das condições de recompensa. Faça uma pausa quando a cobertura de expansão cai, tente novamente a dívida cruzar seu limite, o conjunto protegido regressar, o pai se torna indisponível ou o canário não pode verificar um efeito externo. O treinador ainda está ativo descreve a atividade, não o progresso útil. Respeitar os limites estabelecidos pelo projecto O projeto Documentação responsável AI, financiado por compromissos, descreve o Agent Lightning como orientado para a investigação, pede novos testes antes do uso comercial ou no mundo real e aconselha contra contextos de tomada de decisão de alto risco. Também deixa a precisão, a segurança, a justiça, a privacidade, os direitos dos conjuntos de dados e a supervisão humana ao utilizador. Um portal de actualização suporta essa responsabilidade; não a descarta. O dispositivo não pode provar a segurança aberta, detectar todas as mudanças de distribuição, ou fazer um pequeno canário de língua inglesa representativo de outra língua ou domínio regulamentado. A sua promessa útil é mais estreita: as atualizações positivas em relação à recompensa, mas pouco comprovadas, permanecem em quarentena por uma razão verificável. A regra de funcionamento resultante é simples: deixe o Agente Lightning otimizar os candidatos, mas faça a promoção uma decisão reversível separada, apoiada por evidências. Mantenha o limite do algoritmo Runner visível, preserve o pai exato, declare evidências esperadas antes do treinamento, verifique o resultado real do canário e exija autoridade antes de alterar o padrão. A Sidewisp está atualmente em prévia privada. A sua direcção de produto é a saúde do agenteacessível, o progresso útil, o acesso às ferramentas, os resultados, os custos, as evidências e os limites de aprovação segurosmas a monitorização do agente Lightning de produção não é apresentada aqui como uma integração enviada.