2026-08-01T08:39:03.735Z
Agente Lightning: Desligue todas as atualizações RL antes que cheguem a um agente
Transforma as implementações do Agente Raios, os intervalos, as recompensas, os resultados dos canários, a aprovação e o regresso em um portal apoiado por evidências para cada recurso treinado.
O artigo Agent Lightning: Train ANY AI Agents with Reinforcement Learning responde a uma importante pergunta de engenharia: como um agente existente pode gerar dados de treinamento sem ser reconstruído em torno de um ciclo RL? Não responde à questão de libertação que se segue: quando é que um recurso recém formado deve ser autorizado a influenciar um fluxo de trabalho real? O padrão seguro é manter cada novo modelo ou recurso como candidato. Promove o apenas depois de poder juntar se à atualização para seu pai exato, snapshot de dados, avaliador, tentativas de implantação, cobertura de vestígios, casos protegidos, resultados limitados de canários, aprovação e rollback testado. Uma recompensa maior é uma prova útil, mas não é um veredicto de saúde. Esse limite se encaixa no quadro, em vez de combatê lo. O Agente Lightning já separa a execução do Agente do algoritmo de aprendizagem. Preserva essa separação como um portão de libertação. O que o Agente Lightning registra e o que esses registos provam O papel apresenta o Agente Lightning como uma forma de desacoplar a execução do agente do treinamento RL. Modela a execução de agentes como um processo de decisão de Markov, converte as trajetórias de agentes em transições de treinamento através de um módulo de atribuição de crédito e relata experimentos sobre texto para SQL, geração aumentada de recuperação e uso de ferramentas matemáticas. A Documentação do projeto atual dá aos operadores substantivos mais concretos: um Resource é um ativo que o algoritmo pode atualizar, como um modelo ou um modelo de solicitação; Uma Rollout é uma unidade de trabalho realizada contra um recurso; Uma Attempt é uma execução dessa implantação, incluindo retemps; um Span registra um evento ou rastro da execução; Um Reward é um julgamento numérico associado a um determinado período de implantação; O LightningStore conecta o Runner, que executa o agente, ao algoritmo, que consome evidências e atualiza recursos. Esta é uma interface de treinamento forte. Não é um recibo completo de libertação. Considere um lançamento eventualmente bem sucedido que necessitou de quatro tentativas. A recompensa final pode parecer boa, enquanto as tentativas retomadas revelam não determinismo, dívidas de custo ou uma dependência que falha intermitentemente. Um segundo lançamento pode ter uma grande recompensa, enquanto 31% dos seus períodos esperados estão faltando. Um terceiro pode melhorar a pontuação média da avaliação ao mesmo tempo em que rompe o único caso protegido que impede uma chamada de ferramenta destrutiva. São diferentes falhas: Registo Pergunta útil que ele responde Pergunta que não responde sozinha Lançamento Que tarefa foi tentada? Existia o resultado externo pretendido? Tentação Quantas execuções ocorreram, e como terminaram? O último sucesso foi estável ou apenas sorte? Espanha Que acontecimentos instrumentais foram observados? Os efeitos importantes não instrumentalizados eram corretos? Recompensa Como um juiz nomeado marcou algum comportamento? O comportamento protegido, a privacidade e o retrocesso permaneceram intactos? Atualização de recursos Que modelo ou prompto se tornou disponível? Esse recurso deve tornar se o padrão? A distinção importa porque a arquitetura oficial permite que o algoritmo aprenda a partir de intervalos e atualize recursos sem que o Corredor se torne uma autoridade de implantação. Isso é uma característica. Não o apague tratando o recurso mais recente como o recurso aprovado. Coloque um recibo em torno da atualização do treinamento Use um único recibo de actualização imutável, montado em três fases. O recibo pode ficar fora do Agente Lightning enquanto armazenar identificadores estáveis que se juntam aos registos da LightningStore. Antes da formação: congelar a identidade e a autoridade Registrar a identificação do recurso candidato, a identificação exata do recurso mãe, o snapshot de dados de treinamento, o snapshot de dados mantidos, a versão do avaliador, a configuração do algoritmo, a revisão do código e o alcance previsto. Indicar qual ator pode aprovar um canário e qual ator pode tornar o recurso o padrão. O pai deve resolver para um artefato que ainda pode carregar. Como a última atualização não é um alvo de retrocesso quando a aprendizagem contínua produziu três recursos mais novos desde que a instrução foi escrita. Mantenha o avaliador, os casos protegidos, a política de promoção e o histórico de regresso fora da superfície escrita do aluno. Caso contrário, um optimizador pode melhorar sua pontuação aparente alterando a regra em vez do comportamento. Durante a formação: contabilização das tentativas e cobertura das provas Para cada implantação nas janelas de formação e validação admitidas, manter: As famílias exatas dependem do fluxo de trabalho. A invariante é mais importante do que os nomes: declarar quais evidências devem existir antes de analisar o resultado, em seguida, relatar evidências faltantes como indisponíveis. Não converta a ausência num valor saudável. As tentativas merecem o seu próprio contador. Um lançamento com uma tentativa finalizada e catorze falhas silenciosas não é equivalente a um lançamento que terminou uma vez. Decidir um orçamento de retomada antes da formação, distinguir o retomado esperado das retomadas de infraestrutura e manter a razão de cada tentativa. Após a formação: sucesso de aprendizagem separado da admissão operacional Primeiro, comparem candidato e pai em um lugar de espera fechado. Relatar o resultado agregado, mas também definir orçamentos de tolerância zero ou limitados para as famílias de casos protegidos. Em seguida, executar o candidato em um canário que não pode exceder uma tarefa explícita, tempo, ferramenta, custo, e efeitos colaterais limite. O recibo canário deve verificar o destino, não apenas o comando. Se o agente deveria criar um arquivo, consultar o caminho esperado e validar o seu conteúdo. Se é suposto atualizar um bilhete, leia o bilhete de volta. Se o efeito não puder ser verificado deterministicamente, registar o juiz mais fraco ou evidência humana e sua incerteza. Finalmente, teste de retorno. Carregar o pai exato no mesmo ambiente limitado e provar que o roteamento pode voltar a ele. Só um agente humano autorizado ou sujeito a políticas de liberação deve aprovar o próximo passo. Um experimento com quatro candidatos Encodifiquei o portal como uma fixação determinista do Node.js. Cada candidato melhora a pontuação. Diferem apenas em termos de evidências operacionais: O dispositivo avalia sete verificações: 1. O recurso, o modelo mãe, a imagem instantânea do conjunto de dados e o avaliador são fixados; 2. Cada implantação concluída tem uma cobertura completa do período de tempo esperado; 3. A dívida inesperada de retomada é zero; 4. O candidato bate o seu pai exato no retalho fechado; 5. Não há regressos em casos protegidos; 6. Todas as tarefas limitadas de canaria têm um resultado verificado e não registados efeitos nocivos; 7. O rollback resolve se e foi testado, e um ator autorizado aprovou o passo. A sua saída é intencionalmente inconveniente: A maior recompensa ganha perdem. Candidato C melhora 0,10 mas quebra três casos protegidos. Candidato B melhora 0,08 mas tem apenas 83 lançamentos completos de 120 e catorze repetições inesperadas. O candidato D melhora 0,07 mas verifica apenas 18 dos 20 resultados canários e não consegue resolver ou testar o seu pai. O candidato A passa todos os sete cheques, mas o seu veredicto é deliberadamente PROMOTE TO BOUNDED CANARY , não safe ou deploy em todos os lugares. A prova de passagem tem um escopo: este pai, estas instantâneas, este avaliador, estes casos protegidos, este canário e esta janela de observação. O artefacto executável e sua saída legível por máquina tornam a tese falsificável. Mude um campo, reinicie o e inspecione o cheque falhado. A política é rigorosa por conceito, mas os seus limiares podem ser traduzidos para um fluxo de trabalho real, em vez de ocultos em prosa. A aprendizagem contínua requer uma regra de frescura A documentação do Agente Lightning também descreve um modo de aprendizagem online ou contínua. Os corredores podem relatar lançamentos e intervalos oportunistas; o algoritmo pesquisa novas evidências e pode atualizar os recursos quando chegarem dados suficientes. Esse ciclo faz da frescura parte da correcção. Um painel que diz candidato melhorou sem nomear o corte de dados, versão de avaliador, fonte principal e janela canária está apresentando uma conclusão que não pode ser reconstruída. Usar dois indicadores: O latest candidate resource pode avançar sempre que o algoritmo criar uma atualização; O approved default resource avança apenas após o recebimento completo da atualização passar. Nunca os alias. Um consumidor que solicite a autorização de inadimplência não deve receber silenciosamente o mais recente candidato. Também define uma regra de evidências obsoletas. Se o avaliador, o contrato de ferramentas, a distribuição de tarefas ou a parente mudar após o gate ser executado, anule os controlos afetados. Um canário anterior não cobre automaticamente uma nova autorização, destino, modelo de servidor ou política de retest. Para o treinamento de longa duração, as condições de parada pertencem ao lado das condições de recompensa. Faça uma pausa quando a cobertura de expansão cai, tente novamente a dívida cruzar seu limite, o conjunto protegido regressar, o pai se torna indisponível ou o canário não pode verificar um efeito externo. O treinador ainda está ativo descreve a atividade, não o progresso útil. Respeitar os limites estabelecidos pelo projecto O projeto Documentação responsável AI, financiado por compromissos, descreve o Agent Lightning como orientado para a investigação, pede novos testes antes do uso comercial ou no mundo real e aconselha contra contextos de tomada de decisão de alto risco. Também deixa a precisão, a segurança, a justiça, a privacidade, os direitos dos conjuntos de dados e a supervisão humana ao utilizador. Um portal de actualização suporta essa responsabilidade; não a descarta. O dispositivo não pode provar a segurança aberta, detectar todas as mudanças de distribuição, ou fazer um pequeno canário de língua inglesa representativo de outra língua ou domínio regulamentado. A sua promessa útil é mais estreita: as atualizações positivas em relação à recompensa, mas pouco comprovadas, permanecem em quarentena por uma razão verificável. A regra de funcionamento resultante é simples: deixe o Agente Lightning otimizar os candidatos, mas faça a promoção uma decisão reversível separada, apoiada por evidências. Mantenha o limite do algoritmo Runner visível, preserve o pai exato, declare evidências esperadas antes do treinamento, verifique o resultado real do canário e exija autoridade antes de alterar o padrão. A Sidewisp está atualmente em prévia privada. A sua direcção de produto é a saúde do agenteacessível, o progresso útil, o acesso às ferramentas, os resultados, os custos, as evidências e os limites de aprovação segurosmas a monitorização do agente Lightning de produção não é apresentada aqui como uma integração enviada.