2026-08-01T08:39:15.158Z

리저닝뱅크: 프로모션 전에 자발적인 기억을 감사하십시오

ReasoningBank을 출처, 내구성, 독립적인 검증, 그림자 회귀 테스트 및 롤백으로 운영자 준비된 메모리 게이트로 전환하십시오.

ReasoningBank: Scaling Agent Self Evolving with Reasoning Memory 에 대한 유용한 답은 공사자가 모든 실행 후 자신의 기억을 다시 쓸 수 있도록 하지 않습니다. 논문은 성공적인 및 실패한 궤도에서 전략을 분비하는 유망한 방법을 제시합니다. 운영자는 이러한 전략 중 하나가 실시간 작업에 영향을 미칠 때 결정하기 위해 별도의 규칙이 여전히 필요합니다. 격리제를 기본으로 사용하세요. 새로운 메모리 아이템이 어디에서 왔는지 추적할 수 있을 때까지 적극적으로 검색하지 않도록 유지하세요. 올바른 저장된 것을 증명하고, 가능한 한 원천 결과를 독립적으로 확인하고, 고정된 그림자 스위트에 실행하고, 행동으로 되돌아간다면 이전 은행으로 돌아가십시오. 프로모션은 추출의 부작용이 아닌 명시적인 결정이어야 합니다. 그 경계는 논문의 핵심 아이디어를 보존하면서 다른 질문을 다루고 있습니다. 논리 기억이 벤치마크 성능을 향상시킬 수 있는지 아닌, 특정 메모리 업데이트가 다음 실제 작업에 영향을 미칠 만큼 건강하다는 것입니다. 리저닝뱅크가 어떤 기여를 하고 어떤 테스트를 하고 있는지 리저닝뱅크의 논문는 원료 궤도 재사용을 콤팩트 전략 메모리로 대체한다. 각 항목은 제목, 한 문장 설명 및 논리 단계, 결정의 합리화 또는 운영적인 교훈을 포함하는 내용을 가지고 있습니다. 루프는 세 부분으로 이루어져 있습니다. 1. 새로운 작업에 대한 관련 항목을 검색하는 것 2. 완성된 궤도를 판단하고 성공이나 실패로부터 교훈을 얻으려면 3. 그 항목들을 다시 은행에 통합합니다. 실패 경로는 중요합니다. 실패한 브라우저 궤도는 페이지 설정 작업을 반복하기 전에 페이지 식별자를 확인하는 것과 같은 예방적인 교훈을 줄 수 있습니다. 이것은 긴 연속 클릭을 저장하는 것보다 더 재사용가능합니다. 구글 리서치 설명는 동일한 검색, 추출 및 통합 루프를 설명하고 WebArena 및 SWE Bench Verified에서 메모리 무료 및 이전 메모리 기본 라인에 대한 개선 사항을 보고합니다. 그 결과는 평가된 설비의 방법의 증거가 아니라 생산 보증입니다. 논문은 LLM as a judge를 사용하여 기본 진실 피드백 없이 궤도를 표시합니다. 새로 추출된 품목은 절단 없이 직접 첨부된다. 검색은 유사성을 함축하는 데 기반을 둔다. 저자들은 의도적으로 그 조각들을 단순하게 유지해서 논리적인 내용의 가치를 분리할 수 있습니다. 프로젝트s 참조 저장소는 그 경계를 강화합니다: 웹 아레나와 SWE 벤치 코드를 공개하고, README는 프로젝트가 시범용이며 생산을 위해 의도되지 않는다고 말합니다. 그 말은 유익한 경고입니다. 결함이 아닙니다. 연구 구현과 운영 통제는 서로 다른 문제를 해결합니다. 프로모션 당국의 메모리 콘텐츠를 분리 ReasoningBanks {title, description, content} 스키마는 인간에게 읽을 수 있고, 프롬프트에 쉽게 주입할 수 있습니다. 소스 궤도 ID, 추출 해시, 검증기 유형, 버전, 유효기간, 충돌 세트, 그림자 결과, 승인자 또는 롤백 포인터가 필요하지 않습니다. 그건 실험에 적합합니다. 생산에 영향을 미치는 변화의 유일한 기록으로서는 충분하지 않습니다. 각 추출된 품목을 사업자 봉투에 포장한다. 이 봉투는 기억을 진실하게 만들지 않습니다. 결정이 검증될 수 있게 해줍니다. 또한 5개의 사건들을 분리하여 하나의 사건으로 쉽게 분해할 수 있습니다: 추출이 완료되었고, 글이 성공했고, 항목은 재읽기를 살아남았으며, 그림자 사건에 대한 조언이 도움이 되었으며, 권한이 있는 사람이 적극적으로 검색하도록 허용했습니다. 그 구별은 중요하기 때문입니다. 활동은 진보가 아니기 때문입니다. 메모리 뱅크는 모든 작업 후에 성장할 수 있지만 검색 품질은 떨어집니다. 논문 자체의 압축에서, 하나의 관련 경험을 사용하여 더 큰 집합을 사용하는 것을 때렸습니다. 성공은 그 평가된 환경에서 2, 3 및 4 경험이 검색됨에 따라 떨어졌습니다. 결과는 보편적인 top k 를 정의하지는 않지만, 더 기억되는 물질은 자동적으로 더 건강하지 않다는 유혹적인 운영 가정을 반박합니다. 승진 전에 5개의 증명서를 요구하세요 아래의 다섯 가지 증거는 의도적으로 독립적입니다. 한 기둥의 통과는 다른 기둥의 실패를 보상하지 않습니다. 1. 출처 출처 궤도, 관찰된 결과, 추출 명령어 또는 버전 및 유발된 항목의 해시를 기록하십시오. 출신이 없는 기억은 그 조언이 합리적이라고 들리더라도 격리되어 있어야 합니다. 그렇지 않으면 사업자는 현재 추출을 노후 수입, 복제 항목 또는 수동 편집에서 구별할 수 없습니다. 2. 내구성 성공한 문자 호출을 보존된 메모리와 비교하지 마십시오. 저장된 항목을 실행시간이 사용할 동일한 경계로 다시 읽고, 해시를 비교하고 해당 리스타트 또는 인덱스 업데이트 후에 체크를 반복하십시오. 실종되거나 변경된 항목은 지속성 오류입니다. 사용되지 않는 읽기 경로는 unknown 입니다. 3. 독립적인 결과 증거 이 논문은 잡음을 판단하는 강도를 보고하지만 LLM as a judge에 대한 의존도 한계로 나열합니다. 운영 프로모션을 위해 결정적 검증기를 선호합니다: 예상 파일 해시, 통과 테스트, API 상태, 줄 수, 또는 다른 작업 특정 수신. 기계적으로 결과를 확인할 수 없는 경우 인간 검토를 사용하십시오. LLM 판결은 검토를 우선시할 수 있지만 미래의 행동을 변화시키는 기억에 대한 유일한 권위가 아닙니다. 4. 그림자 회귀 및 유도 커버링 라이브 작업에 영향을 미치지 않고 버전된 스위트에 대한 후보를 실행하십시오. 전략이 도움이 되는 경우, 비관리적인 경우, 과잉 적용이 해로운 경우 적어도 한 가지의 경계 사례를 포함합니다. 결과를 비교해 보세요. 순수하지 마세요. 은행 버전, 모델, 도구 및 고정 버전을 추적하여 나중에 변경되는 것은 메모리 유동으로 가려지지 않습니다. 임무를 수행하는 위험에 해당하는 임대점입니다. 이 수치는 4개의 경우와 80%의 합격률을 사용하여 결정 규칙을 재현할 수 있게 해줍니다. 이 숫자는 일반적인 권장 사항이 아닙니다. 파괴적인 도구는 모든 중요한 사건을 통과시켜야 할 수 있습니다. 역전성 작사 보조는 다른 한계를 용납할 수 있습니다. 5. 명시적인 승인 및 반전 준비 기술 검사를 통과하는 것은 승인 준비, 자동 프로모션이 아닙니다. 이전 은행을 변경할 수 없도록 유지하고, 활성 버전을 기록하고, 역전기를 유발하는 신호를 정의합니다. 승진 후, 작은 카나리 세트를 다시 실행하고 검증된 작업 결과를 보세요. 중요한 회귀가 나타나면, 먼저 이전 버전을 복원하고, 두번째로 조사하십시오. 6개의 불편한 사건에 대한 결정 규칙을 재현 저는 게이트를 작은 Node.js 분류자로 암호화하고 6명의 후보에 맞게 실행했습니다. 이 규칙은 출처 확인, 쓰기 더 다시 읽기 지속 영수, 결정적 또는 인간적인 결과 증거, 그림자 커버링, 활성 메모리 충돌 및 롤백 포인터를 확인합니다. 그 다음에는 다음과 같은 우선순위가 적용됩니다. 주문은 의도적이죠. 적극적인 회귀는 원래 승진이 승인되었음에도 불구하고 역전환이 필요합니다. 실종된 증거는 승인으로 복구될 수 없습니다. 갈등은 두 가지 전략이 서로 다른 범위를 가질 수 있기 때문에 자동적으로 실패가 아닙니다. 그러나 활성화 전에 개인이나 더 강력한 결정주의 규칙이 필요합니다. 이 장치를: 고정 출력은 다음과 같습니다. 지원자 증거 조건 결정 mem 001 출처가 없습니다. 재판관만이 판결을 내릴 수 있습니다. quarantine mem 002 출처가 존재하고, 판사는 유일한 결과 증거로 남아 있습니다. quarantine mem 003 모든 증거가 통과되고, 활성 항목과 충돌 review conflict mem 004 기술 검증 통과; 사업자 승인을 받지 않습니다. ready for approval mem 005 모든 증거가 통과되고 승인이 기록됩니다. promote mem 006 활성 항목은 이제 그림자 경계를 실패 rollback 이 장치는 논문이 제공하려고 하지 않는 정보를 추가합니다. 하나의 유도 메모리를 중심으로 구체적인 권위 경계가 있습니다. 그것은 Xnot 를 재현하고, 추출된 모든 전략을 검증하거나, 80% 그림자 점수가 일반화된다는 것을 증명합니다. 분배 전환은 여전히 스위트를 물리칠 수 있습니다. 갈등은 미묘할 수 있습니다. 인간의 승리는 여전히 틀릴 수 있습니다. 이 루프를 해결된 것처럼 하지 않고 작동합니다. 따라서 실용적인 ReasoningBank의 도입은 2개의 은행이 있어야 하며, 1개의 차별화되지 않은 풀이 있어야 합니다. 새로운 추출된 물건들을 받아들이고 증거들을 보존하는 격리 은행 라이브 검색으로 사용되는 버전된 승인된 항목만 포함하는 활성 은행. 이 둘 사이의 전환을 측정하세요. 유용한 신호는 후보자의 나이, 유래가 없어지는 경우, 지속 읽기 실패, 검증기 커버리지, 그림자 회귀, 해결되지 않은 갈등, 액티브 은행 버전, 롤백 준비 및 프로모션 후 결과 파동이 포함됩니다. 헤드라인 건강 기준으로 메모리 항목 수를 사용하지 마십시오. 기다림과 갇힌 상태는 다르게 취급합니다. 허가된 심사위원을 기다리는 후보자는 소유자와 임기가 있는 경우에 해지되지 않습니다. 실종된 증거를 얻지 못한 채 반복적으로 재출출된 후보자는 갇혀 있습니다. 검증기가 사용할 수 없게 된 활성 항목은 불확실하다. 검증된 비판적 회귀가 있는 활성 항목은 다시 롤링되어야 합니다. 마지막으로, 제품 주장을 정직하게 유지하세요. Sidewisp는 현재 비공개 프리뷰 단계입니다. 공공 사이트 및 기사 시스템은 실시간이지만 생산 에이전트 건강 수집, 런타임 어댑터 및 자동 또는 가이드 복구 일반적으로 배송되지 않습니다. 이 문서의 게이트는 Sidewisp의 건강 영역에 맞는 운영자 패턴입니다. Sidewisp이 현재 ReasoningBank을 모니터링하고 기억을 촉진하거나 롤백을 수행한다는 주장은 아닙니다. 합리적인 다음 움직임은 작습니다. 한 가지 제한된 작업 가족을 선택하고, 기본 은행을 동결하고, 출처와 그림자 인증을 후보 기억에 추가하고, 명시적인 승인을 통해 하나의 항목만을 홍보합니다. 결과가 안정적으로 유지되면 권위를 확장하기 전에 부합을 확장하십시오.