2026-08-01T02:45:33.107Z
에이전트 메모리 벤치마크: 한 점수의 뒤의 격차를 감사
AMB, MemoryArena, STATE-Bench를 실제로 생성하는 증거에 지도하고, 다시 시작, 신선함, 충돌 및 목적지 확인을 추가합니다.
agent 메모리 벤치마크 는 테스트가 당신이 잡아야 할 실패와 일치할 때만 유용합니다. 검색 정확도는 저장된 자료를 찾아낼 수 있음을 나타낼 수 있습니다. 그것은 그 자체로 기억이 재발전에서 살아남았는지, 최신 버전이 충돌을 승리로 거두었는지, 또는 에이전트가 의도된 외부 결과를 생성하기 위해 메모리를 사용했는지 보여줄 수 없습니다. 따라서 실질적인 결함이 최고의 점수를 선택하지 않습니다. 가장 위험한 결정을 내리는 방법의 기준을 선택하고, 그 공개된 질문을 가시적으로 유지하고, 그 옆에 작은 생산 칸리어를 실행하십시오. 저는 현재 AMB, MemoryArena, STATE Bench에 대한 세 가지 접근 방식을 7가지 질문들에 대해 검토했습니다. 아무도 전체 운영 집합을 기록하지 않습니다. 세 가지 기준, 세 가지 다른 증거 단위 AMB는 4단계 파이프라인을 문서화합니다. 문서를 섭취하고 맥락을 검색하고 답을 생성하고, 그 다음 두 번째 모델을 사용하여 황금 답변에 대한 답을 판단합니다. 검색 및 섭취 시간을 추적하고 정확성, 속도 및 토큰 비용을 추적합니다. 이는 AMB를 메모리 제공업체들 간의 검색 품질과 경제성에 대한 결정에 유용하게 만듭니다. 이 방법은 또한 데이터 세트 이름에서 agentic가 충분하지 않은 이유를 설명합니다. 기록된 최종 사건은 여전히 생성된 답과 판사의 결과입니다. 그것은 의미 있는 결과 증거이지만, 그것은 에이전트가 목적지를 올바르게 바꾸는 것을 관찰하는 것과 같지 않습니다. 메모리아레나는 증거 단위를 메모리 물리 환경 루프로 이동합니다. 766개의 인간 제작된 작업은 세션마다 상호 의존적인 하위 작업이 있습니다. 후속 행동은 웹 내비게이션, 제한된 계획, 진보적 검색 및 순서적 추론을 통해 이전에 얻은 정보와 피드백에 달려 있습니다. 이 논문은 작업당 평균 57개의 행동 단계를 보고합니다. 이 설계는 회수만 평가의 진정한 약점을 해결합니다. 에이전트가 사실을 검색할 수 있지만 환경이 변할 때 적용하지 못합니다. 메모리아레나는 나중에 행동하기 위해 기억을 중요하게 만듭니다. 하지만 여러 세션의 작업은 자동으로 프로세스 재부팅 테스트가 아닙니다. 배너스가 의도적으로 메모리 컴포넌트를 무너뜨리고 시작 후 내구성 상태를 증명하지 않는 한, 내구성은 별도의 문제입니다. 국정심판는 여행, 고객 지원, 쇼핑 등을 통틀어 450개의 기업 과제를 테스트합니다. 그 에이전트 학습 트랙은 복원 할 수 있는 기억을 공급할 수 있습니다. 제목 매트릭은 작업 완료 패스@1, 5번 5번, LLM에서 평가된 사용자 경험 점수, 작업 당 비용입니다. 득점 경계가 중요합니다. 마이크로소프트의 방출 설명는 상태 변동 작업은 최종 환경 상태에 대한 결정적인 주장을 사용하지만 절차 및 정보 작업은 LLM 판사를 사용한다고 말합니다. STATE Bench 검사 결과은 정확하지만, STATE Bench 결과들은 모두 결정적인 것은 아닙니다. 한 점수를 제조하는 대신 커버링 상태를 유지하십시오 저는 각 문서화된 방법을 7가지 질문으로 구성했습니다. Covered 는 메소드가 질문을 직접적으로 수행한다는 것을 의미합니다. Partial 는 관련 증거를 제시하지만 전체적인 운영 주장을 하지 않는 것을 의미합니다. Not documented 는 정확히 그렇게 말합니다. 프로젝트가 그러한 테스트를 수행 할 수 없다는 비난은 아닙니다. 증거 질문 AMB 메모리아레나 국정심판 검색 품질 커버 부분 부분 기억은 나중에 행동하는 것을 안내합니다. 부분 커버 커버 결정적 최종 결과 부분 부분 부분 고의적으로 재부팅 지속 문서화되지 않은 부분 문서화되지 않은 신선함 및 출처 문서화되지 않은 문서화되지 않은 문서화되지 않은 반복 운용 신뢰성 문서화되지 않은 문서화되지 않은 커버 비용 또는 효율성 커버 문서화되지 않은 커버 이 표는 7개 중 2개나 7개 중 5개로 줄여서는 안 됩니다. 만약 당신이 두려워하는 사건은 업데이트를 살아남은 오래된 환불 정책이라면, 정적 코퍼스에 대한 검색 정확성과 5개의 안정적인 작업 실행은 모두 녹색이 될 수 있습니다. 위험한 충돌이 손상되지 않는 동안. 감사 문서는 매트릭스를 검증하고 복합 점수를 계산하지 않고 모든 밝혀진 운영 질문들을 나열합니다. 그 규칙을 생성된 소스 지원 매트릭스에 대한 실행: 이 결과는 거짓될 수 있습니다. 벤치마크는 메소드를 변경하거나 명시적인 리스타트 설정을 추가하거나 버전 된 출처를 요구하거나 판사를 결정적 목적지 주장으로 대체할 수 있습니다. 공개 방식이 변경되면 매트릭스를 업데이트하십시오. 기록되지 않은 오래된 표기를 민속으로 보존하지 마십시오. 실패에 따라 선택하세요, 순위표에 따라 선택하지 마세요. 경주 끝에 결정하는 구체적인 결정으로 시작하세요. 검색 제공자를 선택하는 경우, AMB의 섭취/ 검색/ 생성/ 판단 분리 및 타이밍 데이터는 직접적으로 유용합니다. 동일한 데이터 세트, 도메인, 생성 모델, 판사 명령어, 그리고 모든 공급자에 대한 모드를 실행하십시오. 그 README는 작은 프롬프트 또는 모델 변경이 두 자릿수로 정확성을 움직일 수 있다고 경고하고 있기 때문에 이러한 버전 핀이없는 비교는 재생이 불가능합니다. 기억되는 정보가 사용 가능하지만 나중에 행동의 변화를 일으키지 않는 것이 위험하다면, 행동 결합 테스트를 사용하십시오. 메모리아레나의 상호 의존적인 하위 작업은 나중에 세션에서 이전 정보가 원인에 의해 필요합니다. 작업 매니지먼트 및 환경 버전을 보존하고, 최종 작업 점수를 제외한 다른 첫 번째 동작을 검사합니다. 만약 메모리가 상태의 작업 흐름을 지속적으로 개선하는지 여부에 대한 결정이 있다면, STATE Bench는 더 강력한 기본값을 제공합니다. 메모리 없는 기본 라인을 동일한 에이전트 + 메모리와 비교하십시오. pass@1, pass^5, cost, and scorer type를 분리하십시오. 평균 완공률의 증가와 합격률의 감소^5은 순수한 승진이 아닙니다. 또한 LLM가 판단한 절차적 합격은 결정적 데이터베이스 주장과 동등하지 않습니다. 이 옵션들은 결합될 수 있습니다. 작은 팀은 너무 정확하지 않거나 비용이 많이 드는 검색 구현을 제거하기 위해 AMB를 실행하고, 집중된 액션 복합 스위트를 실행하고, 반복적인 작업 흐름 결과를 위해 STATE Bench 하위 집합을 사용할 수 있습니다. 각각의 단계가 이름 붙여진 질문에 답하기 때문에 순서가 방어할 수 있습니다. 합동 랭킹 번호는 후보가 합격한 이유를 숨길 수 있습니다. 제한은 중요합니다. 이 감사는 문서화된 방법을 비교하고 모든 기준을 반복하거나 문서화되지 않은 개인 테스트가 존재하지 않는다고 주장하지 않습니다. 합성 작업, 시뮬레이션 사용자, 평가자 모델, 도메인 커버리지, 저장소 개정 등은 결과물이 작업량에 얼마나 많이 전달되는지를 제한합니다. 운영 확인 기준을 추가하여 개방하도록 합니다. 오프라인 증거는 프로모션 경계에 끝나는 것이어야 합니다. 콤팩트한 살아있는 카나리아가 여기서 시작해야 합니다. 실제 메모리는 개인 자료를 포함할 수 있는 경우 콘텐츠 없는 식별자를 사용하십시오. 예를 들어, 무작위 카나리 아이디, 버전, 예상된 결정의 해시 및 유효기간을 작성하십시오. 건강 이벤트에서 원료 인턴, 대화, 비밀 및 고객 데이터를 제외하십시오. 그럼 이 사슬을 실행하세요: 1. A쓰기를 인식합니다. 메모리 이름 공간, 카나리 ID, 예상 버전, 어댑터 버전, 그리고 수신서를 기록하십시오. 성공적인 HTTP 응답은 필요한 인덱스 또는 내구성 저장소가 기록을 받아들인다는 증거가 아닙니다. 2. 실제 리스타트 경계를 넘어 실제로 의존하는 메모리 서비스, 에이전트 런타임 또는 호스트 어댑터를 다시 시작하십시오. 같은 프로세스 안에서 새로운 채팅을 시작하면 다른 경계를 테스트합니다. 3. 신선함과 출처로 읽으십시오. 예상된 버전과 검사 가능한 출처 참조를 요구합니다. 의미론적으로 유연한 오래된 값은 실패가 아니라 거의 놓친 값입니다. 4. 갈등을 입력합니다. 새로운 값을 작성하고 오래된 식별자를 유지하고 해결자가 의도된 승자를 반환하는지 확인합니다. 정책이 마지막 작성, 명시적 버전, 소스 우선 순위 또는 인적 승인을 여부를 기록하십시오. 5. 의 결과적인 행동을 요구합니다. 올바른 도구 주장이 카나리에게 달려있는 작업을 대리인에게 부여하십시오. 모형이 제시하는 설명이 아닌 논증이나 상태 전환을 확인한다. 6. 목적지를 확인합니다. 완료를 나타내는 외부 시스템 또는 유물을 읽으십시오. 지휘 출입, 도구 호출 성공, 그리고 에이전트가 보고한 성공은 활동 증거입니다. 7. 제한 내에서 반복합니다. 모델, 프롬프트, 툴 및 환경 버전을 수정하는 동안 불일치성을 드러내기 위해 충분한 동등한 사례를 실행하십시오. 검증된 결과와 함께 추적 비용은 최소한의 영수증은 이렇게 보일 수 있습니다. 필요한 필드가 없는 경우 메모리 경로를 건강하게 표시하지 마십시오. uncertain 를 반환하고, 마지막 알려진 증거 시간을 보존하고, 불완전한 증거에 대한 안전한 반응은 외부 효과를 반복할 수 있는 자동적인 재 시도가 아닙니다. 당신이 설명할 수 있는 승진 규칙 세 가지 진술이 모두 사실인 경우에만 메모리 변경을 촉진합니다. 선택된 벤치마크는 변경을 동원한 행동을 직접적으로 수행합니다. 반복된 결과는 합의된 비용 한계를 위반하지 않고 품질을 향상시키거나 유지한다. 라이브 카나리 (canary) 는 지속성, 올바른 버전/출처, 결과적으로 사용 및 예상되는 목적지 결과를 다시 시작한다는 것을 증명합니다. 어떤 진술이 뒷받침되지 않는 경우, 그 변경 사항을 평가에서 유지하십시오. 이 규칙은 의도적으로 표가 상승한 것보다 더 엄격하지만, 보편적인 평가 플랫폼을 구축하는 것보다 더 좁습니다. 작은 팀에게 계속하거나 멈출 수 있는 검증 가능한 이유를 제공합니다. Sidewisp의 제품 방향은 미흡한 메모리 읽기 또는 쓰기, 재부팅을 통해 실패한 지속성, 노후 동기화, 리셋, 컨텍스트 성장 및 손실된 의사결정을 건강 신호로 처리합니다. 생산 모니터링 엔진과 런타임 어댑터는 현재 웹 사이트 저장소에 배송되지 않습니다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 만약 그 증거 모델이 에이전트를 운영하는 방식과 일치한다면, 실행 시간을 교체하거나 오프라인 벤치마크를 실시간 건강 인증서로 취급하지 않고 개인 미리보기 대기 목록에 가입할 수 있습니다.