2026-08-01T10:18:35.758Z
Agente AI Auto-melhoramento: Promover mudanças, não auto-editar ao vivo
Congelar todas as mudanças de comportamento propostas, compará-las com o seu pai exato, proteger os orçamentos de regressão, e manter a autoridade e o retrocesso fora do ciclo de escrita.
Um agente AI que se auto melhora não deve reescrever o seu comportamento ao vivo e chamar o progresso da reescritura. O padrão mais seguro é tratar cada pedido proposto, memória, recuperação, política de ferramentas ou mudança de código como um candidato de lançamento não confiável. Congelar o candidato, compará lo com o seu pai exato em evidências que ele não pode editar, verificar todas as métricas protegidas, provar quem pode aprová lo, e manter um alvo de retrocesso resolvivel. Somente então uma pequena mudança reversível pode entrar num canário limitado. Essa regra ainda permite melhorias. Mudança a unidade de confiança. O feedback pode gerar um candidato automaticamente; a ativação requer evidências. A distinção é importante porque a "auto melhoria" abrange mais do que a formação modelo. O Reflexão armazena feedback verbal na memória episódica para que os ensaios posteriores se comportem de forma diferente sem uma atualização de peso. A Auto refinamento alterna o feedback e o refinamento usando o mesmo modelo. Um envio de roteamento, lição recuperada, lista de ferramentas ou script de escrita podem alterar a próxima corrida tão com certeza quanto um novo ponto de verificação. O teu livro de mudanças tem de cobrir todas essas superfícies. Congelar o candidato antes de medir Comece com duas identidades imutáveis: o pai ativo e o candidato. Registros úteis de manifesto de mudança: A digestão impede uma edição silenciosa entre avaliação e canário. A identidade mãe impede que um candidato gerado contra o agent v41 seja promovido para um agent v42 agora ativo. A lista de superfícies escritas revela o raio real da explosão. Uma proposta descrita como uma lição de memória não é tão pequena se o seu processo também pode editar a política de avaliação ou autoridade. Não deixe que o candidato escreva os seus casos de retenção, código de pontuação, limiares de aceitação, política de aprovação ou histórico de regresso. São a regra, a fechadura e a saída de emergência. Um agente que pode alterá los pode aumentar sua pontuação sem melhorar a tarefa. É também por isso que um arquivo de aprendizagem apenas apêndice merece versão. Uma breve lição pode redirecionar a recuperação, suprimir a escalada ou escolha de ferramentas de preconceito em cada execução posterior. Só a memória alterada descreve o mecanismo de armazenamento, não o risco operacional. Comparar o pai e o candidato exatos em evidências fechadas Uma pontuação absoluta dos candidatos é uma prova fraca. Execute o pai e o candidato contra os mesmos IDs de caso, versão do ambiente, aparelhos de ferramentas, política de aleatoriedade e verificador de resultados. Armazenar os resultados combinados. A questão não é se o candidato obteve uma pontuação de 0,86? O Livro de cozinha de agentes auto evolucionários OpenAI demonstra um ciclo prático com uma linha de base, feedback humano ou modelo, avaliações, um limiar de pontuação, um limite de repetição e uma linha de base atualizada. É uma máquina útil para gerar e medir candidatos. Uma decisão de promoção da produção requer um limite mais rigoroso do que um limiar agregado, porque as médias ocultam qual propriedade pagou o ganho. Suponha que o sucesso da tarefa sobe de 0.80 para 0.89 , enquanto a integridade do efeito ferramenta cai de 0.99 para 0.96 . A média pode subir. A alteração ainda falha se efeitos externos duplicados ou faltantes forem inaceitáveis. Tornar explícitas as métricas alvo e as métricas protegidas: Métrica Direcção Regra da promoção Sucesso da tarefa Maior O candidato deve melhorar pelo menos 0.03 Integridade do efeito ferramenta Maior Não é permitida a regressão Roteamento de aprovação Maior A regressão não pode exceder o 0.02 Custo por resultado verificado Baixo O aumento não pode exceder o 0.05 Usar métricas ligadas a resultados observáveis. Um comando que saiu do zero não é prova de que um deliverable existe. Uma chamada de ferramenta em um rastreamento não é prova de que o destino mudou exatamente uma vez. Um juiz modelo pode ajudar com qualidade subjetiva, mas não deve anular um arquivo determinista, banco de dados, permissão ou verificação de efeitos. O conjunto bloqueado deve incluir falhas conhecidas e espera válida. Caso contrário, o agente pode parecer melhorar tornando se mais agressivo: menos escaladas, menos perguntas, conclusão mais rápida e mais efeitos colaterais errados. Incluir pelo menos uma medida fora da banda que o candidato não otimize diretamente. Autoridade de proposta separada da autoridade de ativação Deixar um agente propor uma mudança não implica autoridade para a ativar. Defina a aprovação por superfície e raio de explosão. Uma pequena alteração de encaminhamento imediato pode entrar num canário de 20 tarefas sob uma política pré aprovada. Uma política de recuperação ou uma alteração da política de ferramentas pode exigir um ser humano nomeado. O código de tempo de execução, a lógica do avaliador, o âmbito das credenciais e as ações irreversíveis devem permanecer fora da promoção automática. A Orientação da OWASP sobre a agência excessiva recomenda permissões mínimas, autorização a jusante e aprovação humana para ações de alto impacto. Aplicar a mesma separação à auto modificação. O processo de melhoria só obtém a capacidade necessária para escrever um artefato candidato. Um componente diferente e menor é responsável pela avaliação e promoção. Um recibo de autoridade útil inclui: Proporcionar o recebimento ao candidato em uma aplicação real. Expirar. Não aceite que o agente possa melhorar como uma permissão executável; não tem uma superfície, limite e limite de tempo. Esperar a aprovação não é um fracasso. Se as provas passarem, mas a superfície de mudança requer uma pessoa, devolver o AWAITING APPROVAL com a digestão candidata, os deltas medidos, a superfície solicitada, o alvo de regresso e o tamanho do canário proposto. A corrida é saudável quando essa espera tem um dono e uma decisão retomável. Execute os portões em ordem fixa A ordem torna o resultado explicável. Rejeitar os problemas estruturais antes de debater os resultados: 1. Identidade: o digesto é válido e o pai do candidato ainda está ativo. 2. Superfície protegida: o candidato não pode escrever testes, dados de retenção, autoridade, histórico de retrocesso ou outra superfície proibida. 3. Piração de evidências: pai e candidato utilizaram o mesmo conjunto de evidências bloqueadas. 4. Budget de regressão: cada métrica protegida permanece dentro do seu próprio limite. 5. Rollback: a versão anterior nomeada ainda resolve. 6. A ganho material: a melhoria alvo limpa o piso pré declarado. 7. A Autoridade: O recibo corresponde ao limite de superfície e canário. Os primeiros cinco portões protegem a segurança e a auditabilidade. O ganho material impede o desgaste: uma alteração que produz ruído, mas que não deve ser realizada nenhuma melhoria útil, não deve ser promovida apenas porque tenha passado por verificações de segurança. A autoridade decide entre revisão humana e canária. O dispositivo de acompanhamento implementa essa prioridade sem um modelo de chamada. Execute o do diretório de artefatos de artigos: Os oito candidatos compartilham deliberadamente uma história de sucesso plausível: a maioria aumenta a pontuação alvo. As suas decisões são diferentes: Candidato Decisão Evidências decisivas Parche de segurança CANARY READY Benefícios associados, não regressão protegida, autorização automática limitada Mudança de recuperação AWAITING APPROVAL A evidência passa; a superfície exige uma pessoa Minúscula lição de memória HOLD NO MATERIAL GAIN Seguro, mas o objetivo de ganho é apenas 0.01 Parente estável BLOCKED IDENTITY Candidato foi gerado a partir da linha de base ativa errada Autor de avaliação BLOCKED PROTECTED SURFACE O candidato pode alterar a regra. Casos privados recentes BLOCKED EVIDENCE O candidato não utilizou o conjunto bloqueado Ganhador agregado BLOCKED REGRESSION A integridade do efeito ferramenta caiu em 0.03 Falta a versão antiga BLOCKED ROLLBACK Artigo de reviravolte denominado não está disponível O resultado útil não é uma pontuação composta de segurança. É um estado e um limite de reparação. Um pai ultrapassado precisa de regeneração. Uma regressão protegida precisa de diagnóstico. Um alvo desaparecido precisa de restauração de artefatos. Averiguar essas falhas esconderia a propriedade. Canário a mudança, não a sua confiança Passar por portões offline torna um candidato elegível para um canário; não prova a saúde da produção. Limite tarefas, tempo, gastos, ferramentas e efeitos colaterais. Mantenha o pai disponível. A rota do canário só funciona cujo resultado pode ser verificado de forma independente. Comparar os seus recibos ao vivo com uma linha de base parental contemporânea ou recente, quando a carga de trabalho o permitir. Defina os gatilhos de retrocesso antes da ativação: violação da métrica protegida, taxa de resultados desconhecida, efeitos duplicados, falta de aprovações, limite de gastos ou falha de frescura de evidência. O rollback significa restaurar o artefato original exato e verificar que o resultado da tarefa pretendida retorne. Um comando de retrocesso que foi concluído é atividade, não recuperação. Preserva três registos após o canário: O candidato imutável e os digestões dos progenitores; Evidências combinadas offline e canárias, incluindo sinais indisponíveis; A decisão de promoção, suspensão, aprovação ou revogação com o recebimento da sua autoridade. Se as provas desaparecerem, devolva o UNCERTAIN e pare a promoção. Não converta uma métrica ausente em um valor saudável. Se a mesma proposta falhar repetidamente, o limite retrata e encaminha o para uma pessoa em vez de deixar o ciclo de melhoria consumir tempo e tokens ilimitados. Sabem o que esta porta não pode provar A auditoria fornecida verifica a forma manifesto, a prioridade, os delta métricos emparelhados, o âmbito da autoridade e a resolução de retrocesso. Não prova que a sua suspensão represente a produção, que uma rubrica humana é correta, ou que uma rara falha aparecerá em 20 tarefas canárias. Os testes podem ficar obsoletos. Os avaliadores podem compartilhar os pontos cegos do modelo. As ferramentas externas podem mudar após o candidato passar. O padrão prático é, portanto, restringido: automatizar livremente a geração de candidatos, automatizar cuidadosamente a avaliação de baixo risco e automatizar a ativação apenas dentro de um envelope de autoridade explícito. Mantenha as superfícies de alto impacto e irreversíveis aprovadas pelo homem. Continuar com o acompanhamento após a promoção, pois um agente que se auto melhora só é saudável quando os seus resultados úteis permanecem saudáveisnão quando a sua linha de atualização está ocupada. A Sidewisp está atualmente em prévia privada. A sua direção é adicionar uma camada de saúde em torno dos tempos de execução dos agentes existentes, com evidências, limites de aprovação e verificação de resultados; adaptadores de monitoramento de produção e sistemas de recuperação geralmente não são enviados. Se esse limite coincidir com a forma como operas agentes, podes fazer Junte se à pré visualização privada.