2026-08-01T08:39:13.128Z
ReasoningBank: проверка саморазвивающейся памяти до продвижения
Превратите ReasoningBank в операторскую память, которая будет доступна с провизией, постоянством, независимой проверкой, тестами регрессии теней и обратной обратной связи.
Полезный ответ на ReasoningBank: Scaling Agent Self Evolving with Reasoning Memory не позволь агенту переписать свою память после каждого запуска. В статье представлен перспективный способ вывести стратегии из успешных траекторий и неудачных . Оператору по прежнему необходимо отдельное правило для решения о том, когда одна из этих стратегий может повлиять на работу на живом экране. Используйте карантин как дефолт. Сохраняйте новый элемент памяти вне активного извлечения, пока вы не сможете отследить, откуда он пришел, доказать, что он был сохранен правильно, независимо проверить исходный результат, где это возможно, запустить его против фиксированного теневого комплекта, и вернуться к предыдущему банку, если поведение регрессирует. Продвижение должно быть явным решением, а не побочным эффектом добычи. Эта граница сохраняет центральную идею статьи, обращаясь к другому вопросу: не то, может ли мыслительная память улучшить производительность эталонов, а то, является ли конкретное обновление памяти достаточно здоровым, чтобы повлиять на следующую реальную задачу. Что вносит ReasoningBank и что проверяет Документ ReasoningBank заменяет повторное использование сырой траектории компактными стратегическими воспоминаниями. Каждый пункт имеет название, описание одного предложения и содержание, содержащее шаги рассуждения, обоснования принятия решений или практические уроки. В цепочке есть три части: 1. получать соответствующие элементы для выполнения новой задачи; 2. оценить завершенную траекторию, а затем извлечь уроки из успеха или неудачи; 3. консолидировать эти пункты обратно в банк. Путь неудачи имеет значение. Неудачная траектория браузера может дать предупредительный урок, например, проверка идентификатора страницы перед повторением действия pagination. Это более многократно используется, чем хранение длинной последовательности кликов. Google Research объяснение описывает тот же цикл извлечения, извлечения и консолидации и сообщает об улучшениях по сравнению с линейками без памяти и более ранней памяти на WebArena и SWE Bench Verified. Эти результаты являются доказательством метода в рамках оцениваемой установки, а не гарантии производства. В статье используется LLM as a judge для маркировки траекторий без обратной связи с основной истиной. Новые извлеченные изделия добавляются непосредственно, без подрезания. Восстановление основывается на внедрении сходства. Авторы намеренно сохраняют эти части простыми, чтобы они могли изолировать ценность содержания, ориентированного на рассуждение. Проект справочный репозиторий укрепляет границу: он выпускает код WebArena и SWE Bench, в то время как его README говорит, что проект предназначен для демонстрации и не предназначен для производства. Это полезное предупреждение, а не дефект. Реализация исследований и контроль работы решают различные проблемы. Отдельное содержание памяти от органа по продвижению Схема ReasoningBanks {title, description, content} читаема человеком и легко вводится в запрос. Он не требует идентификатора траектории источника, хэша извлечения, типа проверщика, версии, срока действия, набора конфликтов, результата тени, одобрения или указателя обратной обратной связи. Это уместно для эксперимента. Это недостаточно, поскольку это единственный показатель изменения, влияющий на производство. Завернуть каждый извлеченный элемент в обложке оператора: Этот конверт не делает память истинной. Это делает решение проверяемым. Он также разделяет пять событий, которые легко могут быть объединены в один: добыча завершена, написание успешно, предмет пережил повторное чтение, совет помог в случае теневых случаев, и уполномоченный человек разрешил его в активном извлечении. Различие имеет значение, потому что деятельность это не прогресс. Банк памяти может расти после каждой задачи, а качество восстановления снижается. В статье собственная абляция, используя один релевантный опыт, победил с использованием более крупных наборов; успех упал, как 2, 3 и 4 опыт были получены в этой оценочной обстановке. Результат не определяет универсальный top k , но опровергает искушающее предположение о работе: более запоминающийся материал не является автоматически более здоровым. Требуйте пять доказательств перед повышением Пять нижеперечисленных доказательств намеренно независимы. Пропуск в одной колонке не компенсирует провал в другой. 1. Происхождение Зарегистрируйте траекторию источника, его наблюдаемый результат, запрос или версию извлечения, а также хэш вынужденного элемента. Память без происхождения должна оставаться в карантине, даже если ее советы звучат разумно. В противном случае оператор не может отличить текущую экстракцию от устаревшего импорта, дублируемого элемента или ручной редакции. 2. Устойчивая стойкость Не сравнивайте успешный звонок с сохраненной памятью. Перечитайте сохраненный элемент через ту же границу, которую будет использовать время запуска, сравнивайте его хэш и повторяйте проверку после соответствующего перезапуска или обновления индекса. Пропущенный или измененный элемент является неисправностью постоянства; недоступный путь чтения unknown , не здоровый. 3. Независимые доказательства результатов В статье сообщается о надежности в оценке шума, но также перечислено зависимость от LLM as a judge как ограничение. Для оперативного продвижения предпочтите детерминистический верификатор: ожидаемый хэш файла, проходящий тест, состояние API, количество строк или другой специальный квитанция задачи. Используйте человеческий обзор, когда результат не может быть проверен механически. Приговор LLM может приоритизировать пересмотр, но не должен быть единственным авторитетом для памяти, которая меняет будущее поведение. 4. Регрессия теней и покрытие дрейфа Запустить кандидата против версионного аппарата, не позволяя ему повлиять на живые задачи. Включить случаи, когда стратегия должна быть полезной, случаи, когда она должна быть неуместной, и, по крайней мере, один предельный случай, когда чрезмерное применение было бы вредно. Сравните результаты, а не бегло. Следите за банковской версией, моделью, инструментами и версией фиксации, чтобы позднее изменение не маскировалось как дрейф памяти. Предел относится к риску выполнения задачи. В сопровождающей фиксировке используются четыре случая и процент прохождения 80% только для того, чтобы сделать правило принятия решений воспроизводимым; эти цифры не являются общим рекомендацией. Разрушительный инструмент может потребовать прохождения каждого критического случая. Реверсибный помощник по подготовке может терпеть другую границу. 5. Явное одобрение и готовность к отказу Прохождение технических проверок означает, что вы готовы к одобрению, а не автоматически продвигаетесь. После продвижения, перезапустите небольшой канарный набор и посмотрите проверенные результаты задачи. Если появляется критическая регрессия, сначала восстановить предыдущую версию; исследовать вторую. Воспроизвести правило принятия решения по шести неблагоприятным делам Я закодировал ворота как небольшой классификатор Node.js и провел его против шести кандидатов. Правило проверяет происхождение, получение записей, подтверждающих непрерывность, детерминистические или человеческие результаты, покрытие теней, конфликты с активной памятью и указатель обратной обратной связи. Затем применяется следующее преимущество: Заказ преднамеренный. Активная регрессия требует отмены даже если первоначальное продвижение было одобрено. Отсутствующие доказательства не могут быть исправлены путем одобрения. Конфликт не является автоматически неудачей, потому что две стратегии могут иметь разные сферы действия, но перед активацией ему нужен человек или более сильное детерминистическое правило. Запустить устройство с помощью: Фиксированный выход был: Кандидат Состояние доказательств Решение mem 001 Никакого происхождения; вердикт только судьи quarantine mem 002 происхождение присутствует; судья остается единственным результатом доказательства quarantine mem 003 прохождение всех доказательств; конфликты с активным пунктом review conflict mem 004 прохождение технических доказательств; отсутствие одобрения оператора ready for approval mem 005 прохождение всех доказательств и утверждение записываются promote mem 006 активный элемент теперь не достигает границы теней rollback Эта фиксация добавляет информацию, которую газета не пытается предоставить: конкретную границу власти вокруг одной индуцированной памяти. Znot воспроизводит эталонные показатели бумаги, подтверждает каждую извлеченную стратегию или доказывает, что 80% ный балл тени будет обобщен. Смена распределения все равно может победить апартамент. Конфликты могут быть тонкими. Человеческое одобрение все еще может быть ошибочным. Используйте петлю , не притворяясь , что она разрешена . Поэтому практическое развертывание ReasoningBank должно содержать два банка, а не один недифференцированный пул: карантинный банк, принимающий новые извлеченные предметы и хранящий их доказательства; активный банк, содержащий только версию утвержденных пунктов, используемых в режиме прямого отзыва. Измерить переход между ними. К полезным сигналам относятся возраст кандидата, отсутствие происхождения, провалы в постоянном чтении, охват проверщиков, регрессии теней, нерешенные конфликты, активная банковская версия, готовность к отказу и дрейф результатов после продвижения. Не используйте количество элементов памяти в качестве показателя здоровья заголовка. Относитесь к ожиданию и застрявшим состояниям по разному. Кандидат, ожидающий уполномоченного рецензента, не нарушается, если у него есть владелец и срок. Кандидат, неоднократно извлекаемый без получения отсутствующих доказательств, застрял. Активный элемент, удостоверяющий устройство которого становится недоступным, является неопределенным. Активная позиция с проверенной критической регрессией должна быть отозвана назад. Наконец, держите заявления о продукте честными. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Его общественный сайт и система статей живы, но коллекция продуктовых агентов здравоохранителей, адаптеры запуска и автоматическое или управляемое восстановление обычно не доставляются. Вход в данную статью представляет собой образец оператора, который соответствует территории здоровья Sidewisp; это не утверждение о том, что Sidewisp в настоящее время контролирует ReasoningBank, способствует воспоминаниям или выполняет обратную работу. Следующий разумный шаг небольшой: выберите одну группу задач, заморозить базовый банк, добавить происхождение и теннисные квитанции к памяти кандидата и продвинуть только один элемент посредством прямого одобрения. Если результат остается стабильным, расширьте свод, прежде чем расширить власть.