2026-08-01T02:45:28.180Z

Benchmark de Memória do Agente: Auditar as lacunas por trás de uma pontuação

Mapa AMB, MemoryArena e STATE-Bench para as evidências que realmente produzem, depois adicione reinicialização, frescura, conflito e verificações de destino.

Um referencial de memória agent é útil somente quando o seu teste corresponde à falha que você precisa detectar. A precisão da recuperação pode mostrar que o material armazenado é encontrável. Não pode, por si só, mostrar que a memória sobreviveu a uma reinicialização, que a versão mais recente venceu um conflito, ou que um agente usou a memória para produzir o resultado externo pretendido. O padrão prático não é, portanto, escolher a pontuação mais alta. Auditei três abordagens actuais AMB, MemoryArena e STATE Bench contra sete perguntas. Nenhum documenta todo o conjunto operacional. Três critérios de referência, três unidades de evidência diferentes O A.M.B. documenta um processo de quatro etapas: ingerir documentos, recuperar contexto, gerar uma resposta, e depois usar um segundo modelo para julgar essa resposta contra as respostas de ouro. Ele rastreia o tempo de recuperação e ingestão, bem como precisão, velocidade e custo do token. Isso torna o AMB útil quando a decisão é sobre qualidade de recuperação e economia entre provedores de memória. O seu método também explica por que o agentic num nome de conjunto de dados não é suficiente. O evento terminal documentado ainda é uma resposta gerada e um resultado do juiz. Essa é uma evidência significativa de resultados, mas não é o mesmo que observar um agente alterar corretamente um sistema de destino. O MemóriaArena move a unidade de evidência para um ciclo de memória agente ambiente. As suas 766 tarefas criadas pelo homem têm subtarefas interdependentes entre as sessões. Ações posteriores dependem de informações e feedback adquiridos anteriormente, através da navegação na web, planejamento restrito, pesquisa progressiva e raciocínio seqüencial. O documento relata uma média de 57 etapas de ação por tarefa. Esse projeto aborda uma verdadeira fraqueza na avaliação apenas de recall: um agente pode recuperar um fato, mas não o aplica quando o ambiente muda. A MemoryArena torna a memória consequente para a ação posterior. No entanto, uma tarefa de várias sessões não é automaticamente um teste de reinicialização do processo. A não ser que o arnes deliberadamente destrua o componente de memória e prove estado duradouro após a inicialização, a persistência permanece uma questão separada. A Tribunal de Contas Estadual testa 450 tarefas empresariais em viagens, suporte ao cliente e compras. A sua pista de aprendizagem de agentes pode fornecer memórias reutilizáveis através de um gancho de recuperação. As métricas principais são pass@1, pass^5 em cinco corridas, uma pontuação de experiência do usuário avaliada pelo LLM e custo por tarefa. O limite de pontuação importa. A Descrição da liberação da Microsoft diz que as tarefas de mutação de estado usam afirmações deterministas contra o estado final do ambiente, enquanto as tarefas processuais e informativas usam um juiz LLM. Os resultados das verificações do STATE Bench são precisos; nem todos os resultados do STATE Bench são deterministas. Mantenha os estados de cobertura em vez de fabricar uma pontuação Mapeei cada método documentado para sete perguntas. Covered significa que o método exerce diretamente a questão. A Partial significa que fornece provas relevantes, mas não apresenta a alegação operacional completa. A Not documented significa exatamente isso; não é uma acusação de que um projeto não possa realizar tal teste. Questão de evidência A.M.B. MemóriaArena Tribunal de Contas Estadual Qualidade de recuperação Coberto Parciais Parciais A memória guia a ação posterior Parciais Coberto Coberto Resultado final determinista Parciais Parciais Parciais persistência de reinicialização deliberada Não documentado Parciais Não documentado Freshness e proveniência Não documentado Não documentado Não documentado Confiabilidade de operações repetidas Não documentado Não documentado Coberto Custo ou eficiência Coberto Não documentado Coberto Esta tabela não deve ser reduzida a dois de sete ou cinco de sete. A cobertura não é aditiva. Se o incidente que temem é uma política de reembolso obsoleta que sobrevive a uma atualização, a precisão de recuperação em um corpus estático e cinco corridas de tarefas estáveis podem ser ambas verdes enquanto o conflito perigoso permanece intocado. O artefacto de auditoria valida a matriz e enumera todas as questões operacionais descobertas sem calcular uma pontuação composta: A execução dessa regra contra a matriz de origem apoiada produzida: Este resultado é falsificável. Um índice de referência pode alterar seu método, adicionar uma fixação explícita de reinicialização, exigir proveniência versada ou substituir um juiz com afirmações deterministas de destino. Atualize a matriz quando o método público mudar. Não conserve um antigo rótulo não documentado como folclore. Escolha pelo fracasso, não pelo ranking Comece com a decisão concreta que tomará depois da corrida. Se estiver a escolher um fornecedor de recuperação, os dados de ingestão/recuperação/geração/julgamento e de cronometragem do AMB são directamente úteis. Execute o mesmo conjunto de dados, domínio, modelo de geração, pedido de julgamento e modo para cada provedor. O seu README adverte que pequenas alterações de prompt ou modelo podem mudar a precisão em dois dígitos, de modo que uma comparação sem esses pinos de versão não é reprodutível. Se o seu risco é que as informações lembradas estejam disponíveis, mas não alterem o comportamento posterior, utilize um teste acoplado a ação. As subtarefas interdependentes do MemoryArena tornam as informações anteriores necessárias causalmente em sessões posteriores. Preservar o manifesto de tarefas e a versão do ambiente, e depois inspecionar a primeira ação que diverge não apenas do resultado final da tarefa. Se a decisão é se a memória melhora consistentemente um fluxo de trabalho com estado, o STATE Bench oferece um padrão mais forte. Compare a linha de base sem memória com o mesmo agente mais memória; mantenha pass@1, pass^5, custo e o tipo de marcador separados. Um ganho na conclusão média, juntamente com uma queda na passagem^5, não é uma promoção limpa. Não é equivalente a uma afirmação de base de dados determinista uma aprovação processual julgada pelo LLM. Estas opções podem ser combinadas. Uma pequena equipe pode executar AMB para eliminar uma implementação de recuperação que seja muito imprecisada ou dispendiosa, em seguida, executar um conjunto de ações ligadas focado, em seguida, usar um subconjunto STATE Bench para resultados de fluxo de trabalho repetidos. A sequência é defensivel porque cada estágio responde a uma pergunta nomeada. Um número de classificação misturado esconderia o motivo de um candidato passar. A limitação é importante: esta auditoria compara métodos documentados; não repete todos os índices de referência ou afirma que não existem testes privados não documentados. As tarefas sintéticas, os usuários simulados, os modelos de avaliador, a cobertura de domínio e as revisões do repositório limitam o grau de transferência de um resultado para a sua carga de trabalho. Adicionar os controlos operacionais A evidência offline deve acabar num limite de promoção. Um canário vivo compacto deve começar lá. Use identificadores sem conteúdo quando a memória real possa conter material privado. Por exemplo, escreva um ID aleatório de canário, uma versão, um hash de uma decisão esperada e um tempo de expiração. Mantenha os dados cru, conversa, segredo e dados de clientes fora do evento de saúde. Então execute esta cadeia: 1. ARecordar o write. Registrar o espaço de nomes de memória, ID de canário, versão esperada, versão de adaptador e receita de escrita. Uma resposta HTTP bem sucedida não é prova de que o índice ou armazenamento duradouro necessário aceitou o registro. 2. Crosse um limite de reinicialização real. Reinicialize o serviço de memória, o tempo de execução do agente ou o adaptador host que você realmente depende. Começar um novo bate papo dentro do mesmo processo testa uma fronteira diferente. 3. Leia com frescura e proveniência. Requer a versão esperada e uma referência à fonte inspecionável. Um valor mais antigo semanticamente plausível é um fracasso, não uma falta próxima. 4. Inject a conflict. Escreva um valor mais novo, mantenha o antigo identificador e verifique se o resolvedor retorna o vencedor pretendido. Registre se a política é de última redação, versão explícita, prioridade da fonte ou aprovação humana. 5. Requer uma ação consequente. Dar ao agente uma tarefa em que o argumento da ferramenta correta depende do canário. Verifique o argumento ou a transição de estado, não a explicação que o modelo produz. 6. Verificar o destino. Ler o sistema externo ou artefato que representa a conclusão. A saída do comando, o sucesso das chamadas de ferramentas e o sucesso relatado pelos agentes são evidências de atividade. 7. Repeat dentro de limites. Execute casos equivalentes suficientes para revelar inconsistência, enquanto fixa versões de modelo, prompt, ferramenta e ambiente. Custo de rastreamento ao lado do resultado verificado. Um recibo mínimo pode parecer assim: Não marque o caminho de memória saudável se um campo requerido não estiver disponível. Retorna o uncertain , preserva o último tempo de evidência conhecido e encaminha o sinal faltante para uma pessoa. A resposta segura a evidências incompletas não é uma retomada automática que possa repetir um efeito externo. Uma regra de promoção que você pode explicar Promover uma mudança de memória apenas quando três declarações são verdadeiras: O indicador de referência escolhido exerce diretamente o comportamento que motivou a mudança; Os resultados repetidos melhoram ou mantêm a qualidade sem violar o limite de custos acordado; O canário vivo demonstra a persistência de reinicialização, a versão/provença correta, a utilização consequente e o resultado de destino esperado. Se qualquer declaração não for apoiada, mantenha a alteração na avaliação. Esta regra é deliberadamente mais rigorosa do que o índice de referência subiu, mas mais estreita do que a construção de uma plataforma de avaliação universal. Dá a uma pequena equipa uma razão auditable para prosseguir ou parar. A direção do produto Sidewisp trata leituras ou gravações de memória faltantes, persistência falhada em restartes, sincronização obsoleta, reset, crescimento de contexto e decisões perdidas como sinais de saúde. O motor de monitorização da produção e os adaptadores de tempo de execução não são enviados no repositório atual do site. A Sidewisp está atualmente em prévia privada. Se esse modelo de evidência coincidir com a forma como você opera agentes, pode aderir à lista de espera de pré visualização privada sem substituir o seu tempo de execução ou tratar um índice de referência offline como um certificado de saúde ao vivo.