2026-08-01T10:18:38.760Z
Самосовершенствование AI Агент: продвигать изменения, не саморедактировать в прямом эфире
Заморозить все предложенные изменения поведения, сравнить их с их родителями, защитить регрессивные бюджеты, и держать авторитет и отказ в работе за пределами записываемой петли.
Самоусовершенствовающийся агент AI не должен переписывать свое поведение на живом экране и называть перепись прогрессом. Более безопасным дефолтом является то, чтобы рассматривать каждый предложенный запрос, память, восстановление, инструмент политика или изменение кода как ненадежный выпуск кандидат. Заморозить кандидата, сравнить его с его родителем на доказательствах, которые он не может редактировать, проверить все защищенные показатели, доказать, кто может его одобрить, и сохранить решаемую цель отсчета. Только тогда небольшое, обратимое изменение может войти в ограниченный канар. Это правило все еще позволяет улучшить. Это меняет единство доверия. Отзывы могут генерировать кандидата автоматически; для активации требуются доказательства. Различие имеет значение, потому что самосовершенствование охватывает больше, чем моделирование. Размышление сохраняет вербальную обратную связь в эпизодической памяти, поэтому поздние испытания ведут себя по разному без обновления веса. Самоочистка взаимодействует с обратной связью и усовершенствованием с использованием одной и той же модели. Запрос на маршрутизацию, извлеченный урок, список инструментов или записываемый сценарий могут изменить следующую работу так же точно, как и новый пункт проверки. Ваш реестр изменений должен охватывать каждую из этих поверхностей. Заморозите кандидата перед его измерением Начнем с двух неизменных идентичностей: активный родитель и кандидат. Полезные записи проявления изменений: Переваривание предотвращает тихое редактирование между оценкой и канарным. Идентичность родителя препятствует продвижению кандидата, созданного против agent v41 , на более активный agent v42 . Список записываемой поверхности показывает реальный радиус взрыва. Предложение, которое описывается как "урок памяти", не является таким маленьким, если его процесс также может редактировать политику оценщика или органа. Не позволяйте кандидату написать свои случаи отказов, коды оценки, пороги принятия, политику одобрения или историю отказов. Это правило, замок и экстренный выход. Агент, который может изменить их, может повысить свой балл, не улучшая задачу. Это также причина, по которой файл обучения, используемый только в приложении, заслуживает версирования. Краткий урок может перенаправить извлечение, подавить эскалацию или выбор инструмента предубеждения на каждом последующем запуске. Только память изменена описывает механизм хранения, а не операционный риск. Сравните точного родителя и кандидата на запертых доказательствах Абсолютный балл кандидата является слабым доказательством. Запустить родитель и кандидата на одних и тех же идентификаторов случаев, версию окружающей среды, устройства инструмента, политику случайности и проверку результатов. Сохраняйте сопоставленные результаты. Вопрос не в том, что кандидат получил 0,86 балла. Вопрос в том, что изменилось по отношению к родителю, в каких случаях и за какую сумму? Книга по кулинарному разработке саморазвивающегося агента OpenAI демонстрирует практическую петлю с базовой линией, человеческой или модельной обратной связью, оценками, порогом оценки, лимитом повторной попытки и обновленной базовой линией. Это полезная техника для создания и измерения кандидатов. Решение о продвижении производства требует более строгой границы, чем один совокупный порог, поскольку средние скрывают, какие имущества оплачивают прибыль. Предположим, что успех задачи повышается с 0.80 до 0.89 , в то время как целостность эффекта инструмента снижается с 0.99 до 0.96 . Средний показатель может вырасти. Изменение все равно не удается, если дублирующие или отсутствующие внешние эффекты неприемлемы. Укажите целевые показатели и защищенные показатели явно: Метрические показатели Направление Правила продвижения Успех задачи Высшее Кандидат должен улучшиться не менее чем на 0.03 Целостность эффекта инструмента Высшее Не допускается регрессия Маршрутизация одобрения Высшее Регрессия не может превышать 0.02 Стоимость на проверенный результат Ниже Увеличение не может превышать 0.05 Используйте метрику, связанную с наблюдаемыми результатами. Командование, которое вышло из нуля, не является доказательством того, что существует добываемое. Призыв к инструменту в след не является доказательством того, что место назначения изменилось точно один раз. Модельный судья может помочь с субъективным качеством, но он не должен отменять детерминистический файл, базу данных, разрешения или проверку эффектов. Закрытый набор должен включать известные неисправности и действительные ожидания. В противном случае агент может казаться лучше, став более агрессивным: меньше эскалаций, меньше вопросов, более быстрое завершение и больше неправильных побочных эффектов. Включить хотя бы одну меру вне полосы, которую кандидат не оптимизирует напрямую. Отдельный орган по предложению от органа по активации Позволить агенту предложить изменение не означает, что он имеет право его активировать. Определить одобрение по поверхности и радиусу взрыва. Небольшое изменение маршрута может попасть в 20 задачный канар под заранее утвержденной политикой. Изменение политики восстановления или политики инструментов может потребовать имя человека. Код запуска, логика оценщика, охват аккредитаций и необратимые действия должны оставаться вне автоматического продвижения. Направления ОВАСП по чрезмерному агентству рекомендует минимальные разрешения, разрешения вдоль потока и одобрение человека для действий с высоким воздействием. Применить такое же разделение к самомодификации. Процесс улучшения получает только необходимую способность для написания артефакта кандидата. У другого, меньшего компонента есть оценка и продвижение. Полезный квитанция органа: Обеспечить реализацию полученного в реальной форме. Вычеркните его. Не принимайте агент может улучшить себя как выполняемое разрешение; ему не хватает поверхности, границы и временной границы. Ждать одобрения это не провал. Если доказательства проходят, но изменение поверхности требует человека, верните AWAITING APPROVAL с кандидатом, измеренной дельтой, запрашиваемой поверхностью, целевой целью перевертывания и предлагаемым размерами канар. Бег здоровый, когда ожидание имеет владельца и решение, которое можно пересмотреть. Запустите ворота в определенном порядке . Порядок объясняет результат. Отрицать структурные проблемы, прежде чем обсудить результаты: 1. IDENTITY: Дигес действителен и родитель кандидата все еще активен. 2. Защищенная поверхность: Кандидат не может писать тесты, данные о сохранении, полномочия, историю свертывания или другую запрещенную поверхность. 3. Сравненные доказательства: родитель и кандидат использовали один и тот же набор запертых доказательств. 4. Бюджет регрессии: каждая защищенная метрика остается в пределах собственных пределов. 5. Rollback: название предыдущей версии все еще решается. 6. Материальная прибыль: Целевое улучшение очищает заранее объявленный пол. 7. Aавторитет: квитанция соответствует пределу поверхности и канарного. Первые пять ворот защищают безопасность и аудитоспособность. Приобретение материала предотвращает зажигание: изменение, которое производит шум, но не должно иметь никакого полезного улучшения, не должно быть продвинуто просто потому, что оно прошло проверки безопасности. Власть решает между канарным и человеческим обзором. Сопроводительное устройство выполняет этот приоритет без моделирования. Запустить из справочника артефактов: Восемь кандидатов намеренно разделяют вероятную историю успеха: большинство повышают целевой балл. Их решения отличаются: Кандидат Решение Решительные доказательства Безопасный пропорциональный патч CANARY READY Совместная прибыль, отсутствие защищенной регрессии, ограниченная автоавтомобильная власть Изменение восстановления AWAITING APPROVAL Доказательства проходят; поверхность требует человека Небольшой урок памяти HOLD NO MATERIAL GAIN Безопасно, но целевой выигрыш только 0.01 Неработающий родитель BLOCKED IDENTITY Кандидат был создан из неправильной активной базовой линии Автор оценщика BLOCKED PROTECTED SURFACE Кандидат может сменить правила Новые частные дела BLOCKED EVIDENCE Кандидат не использовал запертый набор Общий победитель BLOCKED REGRESSION Целостность эффекта инструмента снизилась на 0.03 Пропал старый вариант BLOCKED ROLLBACK Названный артефакт не доступен Полезный результат не составляет сложный безопасность. Это одно состояние и одна граница ремонта. Старый родитель нуждается в регенерации. Защищенная регрессия требует диагностики. Отсутствующая мишень требует восстановления артефакта. Процензирование этих неудач скрыло бы собственность. Канар это перемены, а не уверенность в себе. Прохождение оффлайн ворот делает кандидата подлежащим участию в канарях; это не доказывает здоровье производства. Ограничьте задачи, время, расходы, инструменты и побочные эффекты. Держите родителя в распоряжении. Маршрутизация канаря работает только, результат которого может быть проверен самостоятельно. Сравните его живые поступления с одновременной или недавней базовой базой, если это позволяет рабочая нагрузка. Определить триггеры обратного возврата до активации: нарушение защищенной метрики, неизвестный показатель результатов, дублирующие эффекты, отсутствие одобрений, потолок расходов или доказательство неисправности свежести. Rollback означает восстановление точного основополагающего артефакта и проверка того, возвращается ли предполагаемый результат задачи. Завершенное командование это активность, а не восстановление. Сохраняйте три записи после канарского: неизменный кандидат и родительский пищеварение; соединенные с офлайн и канарные доказательства, включая недоступные сигналы; решение о продвижении, отсрочке, одобрении или отмене с получением полномочий. Если доказательства исчезнут, верните UNCERTAIN и прекратите продвижение. Не преобразуйте отсутствующую метрику в здоровую ценность. Если одно и то же предложение неоднократно проваливается, топик пытается повторно и направляет его к человеку, а не позволяет цикл улучшения потреблять неограниченное время и токены. Знаешь , что эта ворота не может доказать . Предоставленный аудит проверяет формы, преимущества, пары метрических делт, охват полномочий и разрешение на отказ. Это не доказывает, что ваш отказ представляет собой производство, что человеческая рубрика правильна, или что редкий провал будет появляться в 20 канарных заданиях. Тесты могут стать устаревшими. Оценщики могут поделиться слепыми точками модели. Внешние инструменты могут меняться после прохождения кандидатуры. Таким образом, практический дефолт ограничен: автоматизируйте свободное создание кандидатов, тщательно автоматизируйте оценку низкого риска и автоматизируйте активацию только в пределах явной структуры. Сохраняйте высокоэффективные и необратимые поверхности, одобренные человеком. Продолжайте наблюдение после продвижения, поскольку самосовершенствовающийся агент является здоровым только тогда, когда его полезные результаты остаются здоровыми, а не тогда, когда его обновленный трубопровод занят. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Его направление заключается в добавлении слоя здоровья вокруг существующих сроков работы агентов, с доказательствами, границами одобрения и проверкой результатов; адаптеры мониторинга производства и системы восстановления обычно не поставляются. Если эта граница совпадает с тем, как вы управляете агентами, вы можете Присоединяйтесь к частному просмотру.