2026-08-01T14:17:36.096Z

AI Агентские риски безопасности: создание операционной учетной записи угроз

Картографируйте идентификационные данные, разрешения, эффекты инструмента и попробуйте неопределенность до того, как агент перейдет границу доверия.

Практический способ решения рисков безопасности агента AI заключается в моделировании угроз каждой операции с побочным воздействием до вызова инструмента. Зарегистрируйте, какой актив может измениться, какое удостоверение личности предоставляет полномочия, какие области требуются, откуда пришло указание, как будет ограничено действие и какие доказательства делают повторную попытку безопасной. Если какое либо поле неизвестно, остановитесь на этой границе вместо того, чтобы попросить модель вывести разрешение. Это приводит к полезному решению, а не к другому списку рисков. Оператор может продолжить, сократить учетную запись, удалить избыточные разрешения, пересмотреть ненадежную инструкцию, определить предельный эффект или согласовать двусмысленный результат перед повторным испытанием. Достаточно не дать действительного инструмента: безопасность зависит от используемого органа и возникающего внешнего эффекта. Модель угрозы операция, не только модель Агент это больше, чем LLM. Он объединяет модель, время запуска, учетные данные, инструменты, внешний контент и системы назначения в один путь действия. Безопасность бумаги AI Agents делает это различие ясным: агенты используют действия, созданные моделью, чтобы призвать инструменты, которые могут повлиять на реальные системы, создавая проблемы конфиденциальности, целостности и доступности за пределами моделировки. Начните с одной предложенной операции и набросьте четыре границы: 1. Ограничение инструкции: Намерение пользователя, полученный контент, выход инструмента и память входят в контекст модели. 2. AОграничение полномочий: время запуска прикрепляет идентификационный номер или идентификационный номер к предлагаемому инструменту. 3. EЭффектная граница: инструмент может читать или изменять внешний ресурс. 4. Граница загрузки Retry: неопределенные результаты транспортировки или инструмента могут привести к повторению эффекта времени работы. Инициатива по агентской безопасности OWASP описывает свое руководство как ориентировочную базу на модели угроз для возникающих агентических рисков. Это правильная позиция: определить активы, актеров, изменения доверия и возможные последствия перед выбором контролей. Используйте реестр угроз на уровне выполнения вместо записей в свободной форме: Не записывайте секретные ценности в книгу. Сохранить ссылки, идентификаторы эмитента и аудитории, срок действия, сферы действия, идентификация операции и местоположение доказательств. Артефакт должен ответить на вопрос, что может измениться, под чьим руководством и как мы узнаем? Разумным дефолтом является создание одного ряда реестра за каждую внешнюю операцию. Общая модель угроз на уровне агента все еще помогает с архитектурой, но она не может сказать вам, безопасна ли эта конкретная плата, сообщение, выпуск или мутация файла сейчас. До проверки запроса проверять идентификацию удостоверения личности Удостоверение не является безопасным только потому, что оно удостоверяет. За каждую операцию записывайте: кого или что представляет удостоверение; где оно было выпущено и где оно может быть представлено; делится ли она между агентами или средами; его путь истечения срока действия и отзыва; точная аудитория ресурсов; несекретная ссылка, которая позволяет оператору вращаться. В июне 2025 года Спецификация разрешения на MCP является конкретным по поводу границы HTTP. Клиенты включают индикатор ресурсов, серверы подтверждают, что токен был выпущен для целевой аудитории, а недействительные или недостаточные разрешения получают ошибку. Соответствующий Руководящие принципы по безопасности МПК запрещает пропускать токены и объясняет, почему путаница зрителей ослабляет границы контроля, атрибуции и доверия. Эти правила применяются непосредственно к разрешениям MCP HTTP. Также действует принцип: никогда не позволяйте одной непрозрачной точке молча стоять на каждом пункте назначения. Общий токен администратора без владельца задач и узкой аудитории может работать идеально, уничтожая атрибуцию и увеличивая радиус взрыва. Удостоверение в области здоровья и безопасности инструкций отдельно. Чистый запрос не может восстановить просроченный токен, и действительный токен не делает недоверенное указание законным. Сначала проверьте свидетельства, потому что каждый последующий контроль зависит от того, какой идентификатор пересечет границу инструмента. Когда отсутствуют доказательства, используйте stop credential , а не вероятно разрешено. Ремонт механический: выдать кратковременный, отзывный аккредитив для точного агента, задачи, аудитории и среды. Не вмешивайся в это решение. Сравните требуемое разрешение с предоставленным разрешением Минимальные привилегии становятся проверяемыми только тогда, когда сравниваешь два набора для одной операции: Если surplus не пустует, прекратить и заменить грант. Допускаемого инструмента недостаточно. Тот же клиент инструмента может иметь диапазоны, не связанные с текущей работой, и эти спящие разрешения становятся доступными, когда контекст отравлен, аргумент инструмента заменен или модель просто выбирает неправильную операцию. Также отвергают отсутствующие необходимые диапазоны. Этот случай, как правило, менее опасен, чем избыточный авторитет, но он создает шумные повторные попытки и поощряет небезопасные решения, такие как обмен более широкими аккредитивами. Несоответствие разрешения должно привести к одному явному состоянию и одному исправлению, а не приглашению агента искать более сильные секреты. Проверка разрешения требует описания эффекта. Использование инструмента хранилища слишком широкое; создать один кандидат выпуска в хранилище X обеспечивает ресурс и потолок воздействия. При необходимости привязать одобрение к этому замороженному описанию. Человеческий обзор полезен для операций с большим воздействием или без доверия, но не следует просить человека одобрить действие, которое по прежнему имеет неопределенные ресурсы или неограниченные последствия. Вот где модель угрозы отличается от реализации ограждения. В регистре угроз указывается авторитет и эффект, требующие защиты. Политика, одобрение, sandboxing и проверка являются контрольными элементами, выбранными после этого. Начиная с одного управления, команды часто защищают запрос, пока надменная учетная запись остается неизменной. Обращайтесь с инструкциями, эффектами и повторными попытками как с отдельными рисками Внешний контент может влиять на агента, не становясь авторитетом. Отмечание происхождения инструкции как trusted , untrusted external content или mixed . Если ненадежный контент способствует действию, оказывающему побочные эффекты, заморозить предлагаемый ресурс и аргументы, затем потребовать принятия решения о политике или человеческого обзора за пределами этого пути контента. Не решайте эту проблему, удаляя все внешние инструкции. Агент может потребовать извлеченных документов или выхода инструмента для работы. Граница безопасности заключается в том, может ли этот контент молча выбирать привилегированный эффект. Анализ для чтения и отправка сообщения не должны разделять одно и то же правило обзора. Далее определите эффект независимо от реакции инструмента: точный ресурс назначения; максимальное количество или размер изменений; реверсивность и владелец реверсивности; стабильная операционная идентичность; авторитетный обратный анализ или другие доказательства результатов. Опять же, ретриты заслуживают своего ряда, потому что времяпрерыв не означает, что ничего не произошло. AWS Builders Руководство библиотеки по неспособным API показывает, как стабильный идентификатор запросов клиентов может сделать повторные запросы семантически эквивалентными. Этот контракт поддерживает безопасные повторные попытки по умолчанию. Это не разрешает первоначальное действие, и это не помогает, если время выполнения генерирует новый идентификатор для второй попытки. После двусмысленного перерыва, используйте следующий порядок: 1. сохранять оригинальную идентификацию операции; 2. запрашивать авторитетный пункт назначения; 3. классифицировать эффект как присутствующий, отсутствующий, частичный или неизвестный; 4. повторная попытка только в том случае, если договор гарантирует безопасность другой попытки; 5. проверять обещанный результат после окончательной попытки. Если пункт назначения не предлагает ни идемпотенции, ни эффекта поиска, то правильное состояние reconcile before retry . Это может потребовать человека. Это все равно лучше, чем превратить отсутствующие транспортные доказательства в двойную оплату, сообщение, выпуск или удаление. Перезагрузить реестр угроз в девять случаев Сопроводительное устройство делает правило принятия решения проверяемым. security risk cases.json содержит девять предложенных операций. evaluate ai agent threat ledger.mjs проверяет границы в фиксированном порядке: 1. присутствие, истечение срока действия, совместное использование, отзывчивость и аудитория; 2. требуемые объемы деятельности по сравнению с предоставленными объемыми деятельности; 3. ненадежное происхождение инструкции для писем; 4. определение ресурса и максимального эффекта; 5. идентичность операции, несостоятельность и согласование до повторных попыток; 6. независимые доказательства эффекта. Попробуйте: Переданное резюме представляет собой: Продолжаются только два дела. Одно из них ограниченное чтение. Другой это неуместное письмо с точной аудиторией, точной обхватной сетью, именным ресурсом, максимальным влиянием и независимыми доказательствами. Остальные случаи демонстрируют совместное удостоверение личности администратора, токен с истекшим сроком действия, объем удаления излишков, неопроверенное внешнее указание, неограниченный экспорт, повторная попытка с новой идентичностью операции и успешный ответ без доказательства эффекта. Порядок имеет значение. Если разрешение проверяется перед аудиторией, токен с перекрестным обслуживанием может показаться безопасным, потому что его объем совпадает. Если доказательства эффекта проверяются до повторного попытки идентифицировать, оператор может пометить пробег просто неполным, в то время как уже возможна другая небезопасная попытка. Первая опасность доверия должна определить расположение. Приспособите устройство к вашим реальным масштабам и эффектам. Добавьте отсутствующий путь отмены, неправильную среду, устаревшее одобрение, замена ресурсов, частичное написание, отказ в обратном движении и несогласие между выходом инструмента и состоянием назначения. Цель не в том, чтобы предсказывать каждое нападение. Это сделать невозможностью скрыть власть и неопределенность внутри одного статуса зеленого агента. Поддерживайте модель угрозы в действии Проверяйте книгу учета при изменении инструмента, объема, эмитента аккредитаций, API назначения, политики повторного проб или источника инструкций. Не требуется полная рабочая площадка для каждой работы; генерируйте большинство полей из схем инструментов, метаданных идентичности, политики и операционных расписок, а затем спросите человека только о влиянии или неопределенности, которые код не может решить. Правило принятия компактных решений: Продолжайте только тогда, когда идентичность связана с аудиторией, разрешения равны требуемому набору, ненадежные инструкции не могут молча разрешать эффекты, воздействие ограничено, повторные попытки сохранить идентичность операции, а цель может доказать результат. У этого правила есть пределы. Метаданные могут быть ложными или устаревшими. Точный объем может позволить опасный спор. Беспомощность может истечь. Канал обратной чтения может быть скомпрометирован с автором. Таким образом, бухгалтерская книга уменьшает неоднозначность; она не доказывает, что вся система безопасна. Соедините его с разрешением вдоль потока, изоляцией, журналом аудита, тестированием и реакцией на инциденты, соответствующей воздействию. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Он предназначен как слой здоровья вокруг существующих сроков запуска агентов, но сбор и восстановление производственного агента и здоровья не отправляются в текущем хранилище веб сайта. Эта схема учета угроз это то, что операторы могут реализовать в своем собственном режиме работы сейчас, а не утверждение о том, что Sidewisp в настоящее время защищает или контролирует живых агентов. Если вы оцениваете Sidewisp для будущих работ по охране здоровья агентов, присоединяйтесь к частному просмотру. До тех пор держите реестр угроз близко к границе инструмента и дайте неизвестным доказательствам остановить действие, прежде чем оно станет инцидентом.