2026-08-01T14:17:43.633Z

AI Agent Guardrails: Создайте четырехнаправленные ворота действий

Отдельная политика, точное одобрение, пределы исполнения и проверка эффекта перед тем, как доверять агенту инструмент звонок.

Защитные рельсы агента AI не должны иметь одного пропорционального, одного классификатора или одного кнопки одобрения. Для агента, который может изменить внешнее состояние, практическим дефолтом является четырехконтрольная ворота действия: решить, разрешается ли действие, доказать, что звонитель имеет полномочия для этого точного действия, связать попытку, а затем проверить внешний эффект. Каждый контроль отвечает на другой вопрос. Объединение их в единый флаг safe: true скрывает, заблокирован ли агент, ожидает ли он человека, не имеет бюджета, или просто отсутствуют доказательства после вызова инструмента. Держите эти состояния отдельно, и система может потерпеть неудачу, не рассматривая каждую паузу как инцидент. Поставьте политику на границы действия Начните сокращением того, что агент может попросить инструмент сделать. Политические ворота должны получать структурированные данные о действиях, а не только прозу: Результат политики должен быть одним из allow , deny или unknown . Unknown это важно. Отсутствующая классификация не является разрешением, и принуждение двусмысленности к allow или deny делает модель изобретательской уверенностью от имени оператора. Эта ворота должна также проверить, принадлежит ли инструмент к набору возможностей агента. Руководство OWASP по чрезмерному агентству идентифицирует чрезмерную функциональность, разрешения и автономию как отдельные причины. Его смягчения соответственно конкретны: выставляют только необходимые расширения, предпочитают узкие функции перед открытыми командами, предоставляют минимальные разрешения вниз по течению и обеспечивают авторизацию в системе вниз по течению. Эта последняя граница имеет значение. Инструкция, такая как "никогда не удаляйте производственные данные", является полезным контекстом, но не является контролем разрешения. Окончательный пункт удаления должен отвергать несанкционированную личность даже тогда, когда агент приводит убедительную причину. Аналогичным образом, рабочий процесс, предназначенный только для чтения, не должен получать клиента, чьи учетные данные могут быть написаны. Модели ограждения все еще работают, но знайте свое время. OpenAI Agents SDK документация отличает защитные рельсы для ввода/вывода агентов от защитных рельсов для инструментов функций. В нем также отмечается, что параллельный защитный рельс ввода может закончиться после того, как агент уже употребил токены или выполнил инструменты. Для ограничения побочных эффектов используйте блокирующий чек незамедлительно до выполнения, подкрепленный реальным разрешением вдоль потока. Разумный дефолт: отказывают в использовании инструментов вне списка разрешений на каждого агента; вычислять необходимые объемы деятельности из структурированного мероприятия; обеспечивать соблюдение этих сфер вне модели; возвращать unknown , если вводы политики неполны; Зарегистрировать версию политики и акцию с решением. Фильтра содержимого не заменяют эту дверь. Контактная документация на рельсе AWS Connect AI охватывает отрицательные темы, фильтры контента, проверки заземления, фильтры слов и контроль чувствительной информации, а также документирует ограничения конфигурации и компромиссы в латентности. Это полезные гарантии для входов и выходов. Они не доказывают, что выпуск, оплата, сообщение или мутация файла разрешены. Привязывайте одобрение к одному действию, а не к разговору Одобрение слишком неясно для исполнения. Безопасное одобрение это кратковременный конверт, связанный с точным действием, которое совершил проверенный человек. По крайней мере, настаивайте: Возобновить переваривание действий незамедлительно перед исполнением. Если ресурс, аргументы, актер, инструмент, влияние или истечение срока действия отличаются, одобрение не совпадает. Спросите опять, а не откладывайте старый выбор на новую работу. Это предотвращает тихий, но серьезный класс неудач. Человек может одобрить кандидата на выпуск для одного хранилища, затем изменяется контекст агента, повторная попытка восстанавливает различные аргументы или другая попытка повторно использует тот же состояние разговора. Свободно плавающая булевая переживает все три ошибки. Квитанция, связанная с действием, не имеет. Одобрение также требует владельца и состояния, которое может быть переоформлено. awaiting approval не является stuck : оно имеет название решения, маршрут к правильному человеку и срок действия. После принятия решения, продолжить с замороженного объема действий вместо повторного планирования и надеясь, что модель предложит ту же операцию. Не каждое действие нуждается в человеке. Используйте эффект для решения: только для чтения, обратимые действия малого масштаба могут осуществляться в рамках постоянной политики; изменения с ограниченным, хорошо проверенным обратным движением могут использовать явные пределы и аудит; публичные, финансовые, разрушительные, изменяющие привилегии или иные действия с высоким воздействием требуют точного одобрения; двусмысленность относительно маршрутов удара к человеку. Таким образом, человеческий контроль это один контроль внутри стека, а не сам стек. Ограниченное исполнение даже после разрешения Разрешенное и одобренное действие может все равно пойти не так. Исполнителю нужны строгие границы, которые агент не может молча пересмотреть: один абсолютный срок, проверенный до каждой попытки; максимальное количество попыток; ключ к отсутствию побочных эффектов; лимит ресурсов и воздействия; путь отмены; правило о том, что происходит, когда результат неоднозначен. Идентичность операции должна оставаться стабильной во время повторных попыток. Если перевозка прекращается после того, как пункт назначения изменился, выдача новой идентификации может повторить эффект. Если пункт назначения поддерживает идемпотентность, повторно используйте тот же ключ. Если он предлагает авторитетный поиск, примиритесь, прежде чем снова попробовать. Если ни одно из них не существует, прекратите использовать unverified , вместо того, чтобы полагать, что очередная попытка безопасна. Держи исполнителя в механическом состоянии. Модель может рекомендовать повторную попытку, но код должен решить, является ли attempt < maxAttempts , срок свежий, ресурс все еще соответствует, а действие имеет ключ от свободы, который может быть использован. Это одно из редких мест, где скучные условные элементы являются правильным дизайном. Лимиты предназначены не только для устранения повреждений. Они сохраняют диагноз. Без них повторяющийся звонок может выглядеть как постоянство, истекшая срок действия может выглядеть как медленный прогресс, а дублированный эффект может выглядеть как восстановление. С помощью четких границ оператор может различать рабочие, ожидающие, заблокированные и неопределенные состояния. Проверьте эффект самостоятельно Ответ инструмента доказывает, что инструмент сообщил, а не обязательно, что пользователь нуждался. Окончательные ворота сравнивают наблюдаемое последующее состояние с обещанным результатом. Предпочитаю детерминистические доказательства: получить созданный объект с помощью стабильного идентификатора; читать направленную ветвь или запись о выпуске; проверять наличие ожидаемого файла и соответствие его хэширования; проводить соответствующие испытания; подтверждают, что сообщение появляется в предназначенном пункте назначения; сравнивать до и после значения точного ресурса. Не используйте один и тот же слабый сигнал дважды. Если конечная точка записи возвращает { "ok": true } , копирование этого поля в запись завершения не является независимой проверкой. Читайте с достоверного места назначения или проверьте обещанный товар. Некоторые результаты не могут быть подтверждены сразу. Уведомление может быть принято, но не доставлено, внешнему поставщику может не хватать API для чтения или канал наблюдения может быть устарев. Представьте, что как unverified , включать отсутствующие доказательства и следующую безопасную проверку, и избежать сообщения о успехе. Здесь встречаются безопасность и безопасность. Политика и разрешение предотвращают запрещенные действия; проверка эффекта предотвращает ложное завершение. Агент может подчиняться каждому правилу доступа и все равно не справиться со своей задачей. Наоборот, успешный результат не оправдывает несанкционированный путь. Перед тем как доверять дизайну, перезагрузить девять ящиков. Присоединяющийся артефакт превращает четыре управления в небольшой выполняемый тест. guardrail cases.json содержит девять предложенных мер. evaluate agent guardrails.mjs имеет установленный приоритет: 1. политика; 2. объемы деятельности и орган, уполномоченный на утверждение; 3. пределы исполнения; 4. доказательства эффекта. Попробуйте: Переданное резюме представляет собой: Интересные случаи это не пропуск или очевидное отрицание. Одно разрешение истекло. Еще один был выпущен для другого действия отпечатков пальцев. Одна статья исчерпала его бюджет на повторную попытку. Одна команда бежала без видимого эффекта. В одной политике не может быть классифицировано действие вообще. Эти случаи показывают, почему приоритет государства должен быть ясным. Сначала проверьте доказательства эффекта, и несанкционированное действие может быть помечено как просто не верифицированное. Проверьте одобрение перед политикой, и вы можете попросить человека разрешить инструмент, который никогда не должен был быть доступен. Колапс неизвестного в отрицание и оператор теряет восстанавливаемый сигнал качества данных; колапс его в разрешить и система изобретает власть. Приспособите устройство к своим инструментам. Добавьте случаи замены ресурсов, потери сферы действия, повторного использования одобрения, устаревших версий политики, истечения срока действия, частичных эффектов, неудачи реверсирования и канала проверки, который не согласен с ответом инструмента. Ворота готовы только тогда, когда эти неудачи создадут состояние и следующее действие, которое вы намеревались. Держи границу честной Защитные рельсы агента AI работают, когда каждый контроль может наложить вето на действие по собственной причине и разоблачить доказательства этого решения. Условное правило: Политика решает, принадлежит ли действие. Власть связывает, кто может делать именно что. Ограничения ограничивают попытку. Проверка доказывает эффект. Это стоит больше, чем добавление классификатора. Точные одобрения добавляют время ожидания. Читание после письма добавляет звонки. Узкие инструменты требуют инженерии. Неизвестные штаты нуждаются в управлении оператором. Торговля стоит побочных эффектов, потому что двусмысленность остается видимой, а не становится молчаливым авторитетом или ложным успехом. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Он предназначен как слой здоровья вокруг существующих сроков запуска агентов, но сбор и восстановление производственного агента и здоровья не отправляются в текущем хранилище веб сайта. Контрольный столб здесь это схема реализации, которую вы можете протестировать сейчас, а не утверждение, что Sidewisp в настоящее время ее применяет. Если вы оцениваете Sidewisp для будущих работ по охране здоровья агентов, присоединяйтесь к частному просмотру. В то же время держите конверт и его доказательства в своем собственном режиме: самая безопасная ограждающая рельса это та, которая все еще держит, когда модель уверенно ошибается.