2026-08-01T02:45:31.027Z

Анализ памяти агента: проверка пробелов за одним баллом

Карта AMB, MemoryArena и STATE-Bench к доказательствам, которые они фактически производят, а затем добавьте перезагрузку, свежесть, конфликт и проверки назначения.

Сравнительный показатель памяти agent полезен только в том случае, если его тест соответствует провалу, которую вы должны обнаружить. Точность извлечения может показать, что хранившийся материал можно найти. Само по себе оно не может показать, что память пережила перезапуск, что новейшая версия выиграла конфликт или что агент использовал память для получения предполагаемого внешнего результата. Таким образом, практическим дефолтом не является выбрать самый высокий балл. Выберите эталон, метод которого использует ваше наиболее рискованное решение, уделите внимание раскрытым вопросам и запустите рядом с ним небольшой производственный канар. Я проверил три текущих подхода AMB, MemoryArena и STATE Bench на семи вопросах. Никто не документирует весь оперативный набор. Три эталонные показатели, три разные единицы доказательств АМБ документирует четыре этапа: поглощение документов, извлечение контекста, генерирование ответа, а затем использование второй модели для оценки ответа по сравнению с золотыми ответами. Он отслеживает время извлечения и приема, а также точность, скорость и стоимость токенов. Это делает AMB полезным, когда решение касается качества восстановления и экономии между поставщиками памяти. Ее метод также объясняет, почему агентический в названии набора данных недостаточно. Задокументированное терминальное событие все еще является генерируемым ответом и результатом судьи. Это значимое доказательство результатов, но это не то же самое, что наблюдать, как агент правильно меняет систему назначения. ПамятьАрена переносит единицу доказательств в цикл память агент среда. Его 766 выполненных человеком задач имеют взаимозависимые подзадачи по сеансам. Последующие действия зависят от информации и обратной связи, полученной ранее, через веб навигацию, ограниченное планирование, прогрессивное поиск и последовательное рассуждение. В статье сообщается в среднем 57 шагов действий за задачу. Эта конструкция устраняет реальную слабость в оценке только при отзыве: агент может получить факт, но не применить его при изменении окружающей среды. MemoryArena делает память последовательной для последующих действий. Однако многосессионная задача не является автоматическим тестом перезагрузки процесса. Если арнель намеренно не разрушит компонент памяти и не докажет стойкое состояние после запуска, стойкость остается отдельным вопросом. Государственный суд тестирует 450 задач, связанных с развитием бизнеса, в области путешествий, поддержки клиентов и покупок. Его агент учебная трасса может обеспечить многократные воспоминания через зацепку. Главные показатели: пропуск по завершению задачи@1, пропуск по 5 по пяти запускам, оценка пользовательского опыта по оценке LLM и стоимость за задачу. Граница очка имеет значение. Microsoft описание выпуска говорит, что задачи изменения состояния используют детерминистические утверждения против окончательного состояния окружающей среды, в то время как процессуальные и информационные задачи используют судью LLM. Результаты проверок в штате банке являются точными; не каждый результат в штате банке является детерминистическим. Сохранить состояние охвата вместо производства одного балла Каждый документальный метод я распределил на семь вопросов. Covered означает, что метод напрямую использует вопрос. Partial означает, что он предоставляет соответствующие доказательства, но не достигает полного объема эксплуатационных претензий. Not documented означает именно это; это не обвинение в том, что проект не может провести такой тест. Вопрос о доказательствах АМБ ПамятьАрена Государственный суд Качество извлечения Покрытие Частичная Частичная Память помогает в дальнейшем Частичная Покрытие Покрытие Детерминистический конечный результат Частичная Частичная Частичная Умышленное перезагрузка настойчивость Недокументированные Частичная Недокументированные Свежесть и происхождение Недокументированные Недокументированные Недокументированные Надежность повторного выполнения Недокументированные Недокументированные Покрытие Стоимость или эффективность Покрытие Недокументированные Покрытие Данная таблица не должна быть сокращена до двух из семи или пять из семи. Покрытие не является добавленным. Если инцидент, которого вы опасаетесь, является устаревшей политикой возврата средств, пережившей обновление, точность извлечения на статическом корпусе и пять стабильных задач могут быть зелеными, пока опасный конфликт остается нетронутым. Аудиторский артефакт проверяет матрицу и перечисляет все не раскрытые оперативные вопросы без расчета совокупного балла: Использование этого правила против матрицы, поддерживаемой источником, произведенной: Этот результат может быть фальсифицирован. Сравнительный показатель может изменить свой метод, добавить явное устройство перезагрузки, потребовать версионного происхождения или заменить судью определёнными утверждениями о назначении. Обновление матрицы при изменении общественного метода. Не сохраняйте старый недокументированный этикет как фольклор. Выберите по провалу, а не по рейтингу Начните с конкретного решения, которое вы будете принимать после бега. Если вы выбираете поставщика отзывов, то данные о потреблении/отзыве/генерации/определении и сроках AMB являются непосредственно полезными. Используйте один и тот же набор данных, домен, модель генерации, запрос и режим для каждого поставщика. Его README предупреждает, что небольшие изменения в запроте или модели могут изменить точность на два цифра, поэтому сравнение без этих пин версии невозможно воспроизвести. Если вы рискуете, что запоминаемая информация доступна, но не меняет поведение впоследствии, используйте тест, связанный с действием. Взаимозависимые подзадачи MemoryArena делают более раннюю информацию причинно следственной необходимостью в более поздних сессиях. Сохранить манифест задач и версию окружающей среды, а затем проверить первое действие, которое отличается не только от окончательного результата задачи. Если решение заключается в том, улучшает ли память рабочий поток состояния последовательно, STATE Bench предлагает более сильный дефолт. Сравните базовую линию без памяти с одним и тем же агентом плюс памятью; держите pass@1, pass^5, cost, и тип сборщика отдельно. Повышение среднего заканчивания наряду с снижением пропуска не является чистым продвижением. Процессуальный пропуск, оцененный LLM, также не эквивалентен утверждению детерминистической базы данных. Эти варианты можно комбинировать. Небольшая команда может запустить AMB, чтобы устранить слишком неточную или дорогостоящую реализацию восстановления, затем запустить сосредоточенный на работе соединенный набор, а затем использовать подмножество STATE Bench для повторных результатов рабочего потока. Эта последовательность оправдана, потому что каждая стадия отвечает на название вопроса. Смешанный номер лидеров скрывал бы, почему кандидат прошел. Ограничение важно: этот аудит сравнивает документированные методы; он не повторяет каждый показатель или утверждает, что не существует частных недокументированных испытаний. Синтетические задачи, имитируемые пользователи, модели оценщиков, охват доменов и пересмотры хранилищ все ограничивают, насколько результат передается на вашу рабочую нагрузку. Добавить контрольные показатели Оффлайн доказательства должны закончиться на границе продвижения. Там должен начаться компактный живой канарь. Используйте идентификаторы без контента, когда реальная память может содержать частный материал. Например, напишите случайный идентификатор канар, версию, хэш ожидаемого решения и срок его истечения. Держите необработанные запросы, разговоры, секретные данные и данные о клиентах вне медицинского события. Тогда запустите эту цепь: 1. AПризнайте запись. Запишите пространство имен памяти, идентификатор канарей, ожидаемую версию, версию адаптера и запишите квитанцию. Успешный ответ HTTP не является доказательством того, что требуемый индекс или прочный магазин принял запись. 2. Перейти реальную границу перезагрузки. Перезагрузить службу памяти, время запуска агента или адаптер хоста, от которого вы действительно зависите. Начало новой беседы внутри одного и того же процесса проверяет другую границу. 3. Читать свеже и с точностью. Требуйте ожидаемой версии и проверяемой ссылки на источник. Семантически правдоподобное старое значение это неудача, а не неудача. 4. Вводите конфликт. Напишите новую величину, сохраните старый идентификатор и убедитесь, что решитель возвращает предполагаемый победитель. Запишите, является ли политика последней версией, явной версией, приоритетом источника или человеческим одобрением. 5. Require a consequential action. Дать агенту задачу, в которой правильный аргумент инструмента зависит от канар. Проверьте аргумент или переход состояния, а не объяснение, которое производит модель. 6. ВЕРИЧАЙТЕ местонахождение. Читайте внешнюю систему или артефакт, представляющий собой завершение. Выход команды, успех при звонке инструмента и успех агента являются доказательством активности. 7. Прекратите в пределах пределов. Используйте достаточно эквивалентных случаев, чтобы обнаружить несоответствие, при этом исправляйте версии модели, запроса, инструмента и окружающей среды. Стоимость отслеживания вдоль проверенного результата. Минимальный квитанция может выглядеть вот так: Не маркируйте путь памяти здоровым, если требуемое поле недоступно. Возвращайте uncertain , сохраните последний известный время доказательства и направляйте отсутствующий сигнал к человеку. Безопасный ответ на неполные доказательства не является автоматической повторной попытки, которая может повторить внешний эффект. Правило продвижения, которое вы можете объяснить. Продвигать изменение памяти только тогда , когда все три утверждения верны: выбранная эталонная оценка напрямую осуществляет поведение, которое мотивировало изменение; повторяющиеся результаты улучшают или сохраняют качество без нарушения согласованной стоимостной границы; живой канарий доказывает стойкость перезагрузки, правильную версию/поход, последовательное использование и ожидаемый результат назначения. Если какое либо утверждение не подтверждается, сохраняйте изменение в оценке. Это правило преднамеренно более строго, чем повышение эталонного показателя, но более узкое, чем создание универсальной платформы оценки. Это дает небольшой команде проверенную причину для продолжения или прекращения. Направление продукта Sidewisp рассматривает отсутствие чтения или записи памяти, неудачное упорство в перезагрузке, устаревшую синхронизацию, перезагрузку, рост контекста и утраченные решения в качестве сигналов здоровья. Двигатель мониторинга производства и адаптеры времени работы не отправляются в текущем хранилище веб сайта. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Если эта модель доказательств совпадает с тем, как вы управляете агентами, вы можете присоединиться к личным спискам ожидания без замены времени выполнения или обращения с оффлайн беంచ్марком как с живым медицинским сертификатом.