2026-08-01T10:18:35.758Z

Agente AI Auto-melhoramento: Promover mudanças, não auto-editar ao vivo

Congelar todas as mudanças de comportamento propostas, compará-las com o seu pai exato, proteger os orçamentos de regressão, e manter a autoridade e o retrocesso fora do ciclo de escrita.

Agente AI Auto-melhoramento: Promover mudanças, não auto-editar ao vivo
Um agente AI que se auto-melhora não deve reescrever o seu comportamento ao vivo e chamar o progresso da reescritura. O padrão mais seguro é tratar cada pedido proposto, memória, recuperação, política de ferramentas ou mudança de código como um candidato de lançamento não confiável. Congelar o candidato, compará-lo com o seu pai exato em evidências que ele não pode editar, verificar todas as métricas protegidas, provar quem pode aprová-lo, e manter um alvo de retrocesso resolvivel. Somente então uma pequena mudança reversível pode entrar num canário limitado. Essa regra ainda permite melhorias. Mudança a unidade de confiança. O feedback pode gerar um candidato automaticamente; a ativação requer evidências. A distinção é importante porque a "auto-melhoria" abrange mais do que a formação modelo. O Reflexão armazena feedback verbal na memória episódica para que os ensaios posteriores se comportem de forma diferente sem uma atualização de peso. A Auto-refinamento alterna o feedback e o refinamento usando o mesmo modelo. Um envio de roteamento, lição recuperada, lista de ferramentas ou script de escrita podem alterar a próxima corrida tão com certeza quanto um novo ponto de verificação. O teu livro de mudanças tem de cobrir todas essas superfícies. Congelar o candidato antes de medir Comece com duas identidades imutáveis: o pai ativo e o candidato. Registros úteis de manifesto de mudança: A digestão impede uma edição silenciosa entre avaliação e canário. A identidade-mãe impede que um candidato gerado contra o agent-v41 seja promovido para um agent-v42 agora ativo. A lista de superfícies escritas revela o raio real da explosão. Uma proposta descrita como uma lição de memória não é tão pequena se o seu processo também pode editar a política de avaliação ou autoridade. Não deixe que o candidato escreva os seus casos de retenção, código de pontuação, limiares de aceitação, política de aprovação ou histórico de regresso. São a regra, a fechadura e a saída de emergência. Um agente que pode alterá-los pode aumentar sua pontuação sem melhorar a tarefa. É também por isso que um arquivo de aprendizagem apenas apêndice merece versão. Uma breve lição pode redirecionar a recuperação, suprimir a escalada ou escolha de ferramentas de preconceito em cada execução posterior. Só a memória alterada descreve o mecanismo de armazenamento, não o risco operacional. Comparar o pai e o candidato exatos em evidências fechadas Uma pontuação absoluta dos candidatos é uma prova fraca. Execute o pai e o candidato contra os mesmos IDs de caso, versão do ambiente, aparelhos de ferramentas, política de aleatoriedade e verificador de resultados. Armazenar os resultados combinados. A questão não é se o candidato obteve uma pontuação de 0,86? O Livro de cozinha de agentes auto-evolucionários OpenAI demonstra um ciclo prático com uma linha de base, feedback humano ou modelo, avaliações, um limiar de pontuação, um limite de repetição e uma linha de base atualizada. É uma máquina útil para gerar e medir candidatos. Uma decisão de promoção da produção requer um limite mais rigoroso do que um limiar agregado, porque as médias ocultam qual propriedade pagou o ganho. Suponha que o sucesso da tarefa sobe de 0.80 para 0.89 , enquanto a integridade do efeito ferramenta cai de 0.99 para 0.96 . A média pode subir. A alteração ainda falha se efeitos externos duplicados ou faltantes forem inaceitáveis. Tornar explícitas as métricas-alvo e as métricas protegidas: Métrica Direcção Regra da promoção --- --- --- Sucesso da tarefa Maior O candidato deve melhorar pelo menos 0.03 Integridade do efeito ferramenta Maior Não é permitida a regressão Roteamento de aprovação Maior A regressão não pode exceder o 0.02 Custo por resultado verificado Baixo O aumento não pode exceder o 0.05 Usar métricas ligadas a resultados observáveis. Um comando que saiu do zero não é prova de que um deliverable existe. Uma chamada de ferramenta em um rastreamento não é prova de que o destino mudou exatamente uma vez. Um juiz modelo pode ajudar com qualidade subjetiva, mas não deve anular um arquivo determinista, banco de dados, permissão ou verificação de efeitos. O conjunto bloqueado deve incluir falhas conhecidas e espera válida. Caso contrário, o agente pode parecer melhorar tornando-se mais agressivo: menos escaladas, menos perguntas, conclusão mais rápida e mais efeitos colaterais errados. Incluir pelo menos uma medida fora da banda que o candidato não otimize diretamente. Autoridade de proposta separada da autoridade de ativação Deixar um agente propor uma mudança não implica autoridade para a ativar. Defina a aprovação por superfície e raio de explosão. Uma pequena alteração de encaminhamento imediato pode entrar num canário de 20 tarefas sob uma política pré-aprovada. Uma política de recuperação ou uma alteração da política de ferramentas pode exigir um ser humano nomeado. O código de tempo de execução, a lógica do avaliador, o âmbito das credenciais e as ações irreversíveis devem permanecer fora da promoção automática. A Orientação da OWASP sobre a agência excessiva recomenda permissões mínimas, autorização a jusante e aprovação humana para ações de alto impacto. Aplicar a mesma separação à auto-modificação. O processo de melhoria só obtém a capacidade necessária para escrever um artefato candidato. Um componente diferente e menor é responsável pela avaliação e promoção. Um recibo de autoridade útil inclui: Proporcionar o recebimento ao candidato em uma aplicação real. Expirar. Não aceite que o agente possa melhorar como uma permissão executável; não tem uma superfície, limite e limite de tempo. Esperar a aprovação não é um fracasso. Se as provas passarem, mas a superfície de mudança requer uma pessoa, devolver o AWAITING APPROVAL com a digestão candidata, os deltas medidos, a superfície solicitada, o alvo de regresso e o tamanho do canário proposto. A corrida é saudável quando essa espera tem um dono e uma decisão retomável. Execute os portões em ordem fixa A ordem torna o resultado explicável. Rejeitar os problemas estruturais antes de debater os resultados: 1. Identidade: o digesto é válido e o pai do candidato ainda está ativo. 2. Superfície protegida: o candidato não pode escrever testes, dados de retenção, autoridade, histórico de retrocesso ou outra superfície proibida. 3. Piração de evidências: pai e candidato utilizaram o mesmo conjunto de evidências bloqueadas. 4. Budget de regressão: cada métrica protegida permanece dentro do seu próprio limite. 5. Rollback: a versão anterior nomeada ainda resolve. 6. A ganho material: a melhoria-alvo limpa o piso pré-declarado. 7. A Autoridade: O recibo corresponde ao limite de superfície e canário. Os primeiros cinco portões protegem a segurança e a auditabilidade. O ganho material impede o desgaste: uma alteração que produz ruído, mas que não deve ser realizada nenhuma melhoria útil, não deve ser promovida apenas porque tenha passado por verificações de segurança. A autoridade decide entre revisão humana e canária. O dispositivo de acompanhamento implementa essa prioridade sem um modelo de chamada. Execute-o do diretório de artefatos de artigos: Os oito candidatos compartilham deliberadamente uma história de sucesso plausível: a maioria aumenta a pontuação-alvo. As suas decisões são diferentes: Candidato Decisão Evidências decisivas --- --- --- Parche de segurança CANARY READY Benefícios associados, não regressão protegida, autorização automática limitada Mudança de recuperação AWAITING APPROVAL A evidência passa; a superfície exige uma pessoa Minúscula lição de memória HOLD NO MATERIAL GAIN Seguro, mas o objetivo de ganho é apenas 0.01 Parente estável BLOCKED IDENTITY Candidato foi gerado a partir da linha de base ativa errada Autor de avaliação BLOCKED PROTECTED SURFACE O candidato pode alterar a regra. Casos privados recentes BLOCKED EVIDENCE O candidato não utilizou o conjunto bloqueado Ganhador agregado BLOCKED REGRESSION A integridade do efeito ferramenta caiu em 0.03 Falta a versão antiga BLOCKED ROLLBACK Artigo de reviravolte denominado não está disponível O resultado útil não é uma pontuação composta de segurança. É um estado e um limite de reparação. Um pai ultrapassado precisa de regeneração. Uma regressão protegida precisa de diagnóstico. Um alvo desaparecido precisa de restauração de artefatos. Averiguar essas falhas esconderia a propriedade. Canário a mudança, não a sua confiança Passar por portões offline torna um candidato elegível para um canário; não prova a saúde da produção. Limite tarefas, tempo, gastos, ferramentas e efeitos colaterais. Mantenha o pai disponível. A rota do canário só funciona cujo resultado pode ser verificado de forma independente. Comparar os seus recibos ao vivo com uma linha de base parental contemporânea ou recente, quando a carga de trabalho o permitir. Defina os gatilhos de retrocesso antes da ativação: violação da métrica protegida, taxa de resultados desconhecida, efeitos duplicados, falta de aprovações, limite de gastos ou falha de frescura de evidência. O rollback significa restaurar o artefato original exato e verificar que o resultado da tarefa pretendida retorne. Um comando de retrocesso que foi concluído é atividade, não recuperação. Preserva três registos após o canário: - O candidato imutável e os digestões dos progenitores; - Evidências combinadas offline e canárias, incluindo sinais indisponíveis; - A decisão de promoção, suspensão, aprovação ou revogação com o recebimento da sua autoridade. Se as provas desaparecerem, devolva o UNCERTAIN e pare a promoção. Não converta uma métrica ausente em um valor saudável. Se a mesma proposta falhar repetidamente, o limite retrata e encaminha-o para uma pessoa em vez de deixar o ciclo de melhoria consumir tempo e tokens ilimitados. Sabem o que esta porta não pode provar A auditoria fornecida verifica a forma manifesto, a prioridade, os delta métricos emparelhados, o âmbito da autoridade e a resolução de retrocesso. Não prova que a sua suspensão represente a produção, que uma rubrica humana é correta, ou que uma rara falha aparecerá em 20 tarefas canárias. Os testes podem ficar obsoletos. Os avaliadores podem compartilhar os pontos cegos do modelo. As ferramentas externas podem mudar após o candidato passar. O padrão prático é, portanto, restringido: automatizar livremente a geração de candidatos, automatizar cuidadosamente a avaliação de baixo risco e automatizar a ativação apenas dentro de um envelope de autoridade explícito. Mantenha as superfícies de alto impacto e irreversíveis aprovadas pelo homem. Continuar com o acompanhamento após a promoção, pois um agente que se auto-melhora só é saudável quando os seus resultados úteis permanecem saudáveisnão quando a sua linha de atualização está ocupada. A Sidewisp está atualmente em prévia privada. A sua direção é adicionar uma camada de saúde em torno dos tempos de execução dos agentes existentes, com evidências, limites de aprovação e verificação de resultados; adaptadores de monitoramento de produção e sistemas de recuperação geralmente não são enviados. Se esse limite coincidir com a forma como operas agentes, podes fazer Junte-se à pré-visualização privada.