2026-08-01T14:17:38.901Z
AI 에이전트 보안 위험: 운영 위협 레저를 구축
신용번호, 권한, 도구 효과, 그리고 에이전트가 신뢰 경계를 넘기기 전에 불확실성을 다시 시도하십시오.
AI 에이전트 보안 위험을 처리하는 실용적인 방법은 도구 호출 전에 각 부작용 동작을 위협 모델로 하는 것입니다. 어떤 자산이 변경될 수 있는지, 어떤 신원이 권한을 제공하는지, 어떤 범위가 요구되는지, 명령이 어디에서 왔는지, 그 효과가 어떻게 제한될 것인지, 그리고 어떤 증거가 다시 시도를 안전하게 만드는지를 기록하십시오. 어떤 필드가 알려지지 않은 경우, 모델이 허가를 추론하도록 요청하는 대신 그 경계에서 멈추십시오. 이것은 또 다른 위험 목록이 아닌 유용한 결정을 만들어냅니다. 운영자는 계속 진행할 수 있고, 자격증을 좁히거나, 과잉 권한을 제거하거나, 신뢰할 수 없는 명령어를 검토하거나, 효과 제한을 정의하거나, 다시 시도하기 전에 모호한 결과를 조정할 수 있습니다. 유효한 도구 반응은 충분하지 않습니다. 보안은 사용되는 권위와 생성된 외부 효과에 달려 있습니다. 위협 모델은 작전뿐 아니라 모델 에이전트는 LLM보다 더 많습니다. 모델, 런타임, 인증서, 도구, 외부 콘텐츠 및 목적 시스템들을 하나의 행동 경로로 결합합니다. AI 에이전트 종이 안전는 이러한 구별을 명시적으로 합니다. 에이전트는 모델에 의해 생성된 동작을 사용하여 실제 시스템에 영향을 미칠 수 있는 도구를 호출하여 모델 조화를 넘어 비공개성, 무결성 및 가용성 문제를 창출합니다. 제안된 하나의 작업으로 시작해서 네 가지 경계를 그리세요. 1. 지시 경계: 사용자 의도는, 검색 된 콘텐츠, 도구 출력 및 메모리는 모델 맥락에 입력됩니다. 2. A권 제한: 실행시간은 제안된 도구 호출에 정체성 또는 자격증을 붙인다. 3. E 효과 경계: 도구는 외부 리소스를 읽을 수 또는 변경할 수 있습니다. 4. Retry 경계: 불확실한 운송 또는 도구 결과는 실행시간이 효과를 반복하게 할 수 있습니다. OWASP 에이전트 보안 제책는 그 가이드라인을 위협 모델에 기반한 신흥 대행성 위험을 위한 참조로 설명합니다. 이것이 올바른 출발 자세입니다. 통제를 선택하기 전에 자산, 행위자, 신뢰 변화, 그리고 가능한 영향들을 식별합니다. 자유 형태의 메모보다는 실행 수준의 위협 리더를 사용하십시오. 비밀 가치 를 책 에 넣지 마십시오. 저장 참조, 발행자 및 관객 식별자, 만료, 범위, 운영 정체성 및 증거 위치. 이 유물은 또 다른 자격 누출이 되지 않고, 누가 권위를 가지고, 어떻게 알 수 있는지에 대해 대답해야 합니다. 합리적인 기본은 외부 동작에 대해 하나의 리더 라인을 생성하는 것입니다. 일반 에이전트 수준의 위협 모델은 여전히 아키텍처에 도움이 되지만 특정 결제, 메시지, 출시 또는 파일 돌연변이가 현재 안전한지 알 수는 없습니다. 요청사항을 확인하기 전에 인증서 신분 확인 자격증은 인증서일 뿐만이 안전하지 않습니다. 각 작업에 대해 기록: 자격증은 누구 또는 무엇을 나타냅니다; 발급 및 제출 가능한 장소 대원이나 환경에 걸쳐 공유되는지, 그 만료 및 취소 경로; 정확한 자원 관객; 비비밀한 참조로 운영자가 회전할 수 있도록 합니다. 2025년 6월 MCP 허가 사양는 HTTP 경계에 대해 구체적입니다. 클라이언트는 리소스 지표를 포함하고, 서버는 의도된 청중을 위해 토큰이 발행되었음을 확인하고, 무효 또는 충분하지 않은 권한은 오류를 수신합니다. 관련 MCP 보안 지침는 토큰 패스를 금지하고 왜 시청자 혼란이 통제, 배정 및 신뢰 경계를 약화시키는지를 설명합니다. 해당 규칙은 MCP HTTP 권한에 직접 적용됩니다. 운영 원리 또한 잘 작동합니다. 모든 목적지를 위해 결코 불투명한 토큰이 침묵으로 서지 않도록하십시오. 작업 소유자와 좁은 관객이 없는 공유 관리자 토큰은 속성을 파괴하고 폭발 반경을 확대하는 동시에 완벽하게 작동 할 수 있습니다. 자격증 건강과 교육 안전은 분리되어 있습니다. 청정 명령어는 만료된 토큰을 복구할 수 없으며 유효한 토큰은 신뢰할 수 없는 명령어를 합법화하지 않습니다. 먼저 신분증서를 확인하세요. 왜냐하면 모든 후속 통제는 어떤 아이덴티티가 도구의 경계를 넘을지 아는 것에 달려 있기 때문입니다. 증거가 부족할 때 stop credential 를 사용하십시오. 아마도 허가되지 않습니다. 수리 작업은 기계적입니다. 정확한 에이전트, 작업, 관객 및 환경에 대한 짧은 기간, 취소 가능한 자격증을 발급하십시오. 모델이 그런 결정에서 벗어나라. 요구되는 허가와 부여된 허락을 비교하십시오. 최소한의 특권은 하나의 작전을 위해 두 세트를 비교하면 테스트 될 수 있습니다. surplus 가 비공개인 경우 지원금을 중지하고 교체하십시오. 허용된 도구는 충분하지 않습니다. 동일한 도구 클라이언트는 현재 작업과 관련이 없는 범위를 가지고있을 수 있으며, 그 잠자는 권한은 맥락이 중독되거나 도구 논쟁이 대체되거나 모델이 단순히 잘못된 동작을 선택하면 사용할 수 있습니다. 또한 필요한 범위가 빠지는 것을 거부합니다. 이 사건은 보통 과잉 권한보다 덜 위험하지만, 더 넓은 자격증을 교환하는 것과 같은 안전하지 않은 해결방안을 장려하고 소란적인 재발전을 만듭니다. 허가 부합은 명백한 상태와 정리를 만들어야 합니다. 에이전트가 더 강력한 비밀을 찾아야 한다는 초청이 아닙니다. 허가 검사는 효과 설명이 필요합니다. 저장소 도구를 사용하는은 너무 광범위하다; 저장소에서 한 개 발매 후보를 생성 X는 자원 및 영향 천장을 제공합니다. 필요한 경우 frozen description에 승인을 묶어주십시오. 인적 검토는 큰 영향력이나 신뢰할 수 없는 운영에 유용하지만, 아직 이름 없는 자원이나 무한한 효과를 가진 행동을 승인하도록 요청해서는 안 됩니다. 이것이 위협 모델이 경비선 구현과 다른 부분입니다. 위협 리더는 보호가 필요한 권위와 효과를 식별합니다. 정책, 승인, 샌드박스 및 검증은 나중에 선택된 제어 장치입니다. 컨트롤만 시작하면 종종 팀들이 프롬프트를 보호하는 동안 압도적인 자격증은 변하지 않습니다. 명령, 효과, 그리고 재실험을 별도의 위험으로 취급하라 외부 컨텐츠는 권위자가 되지 않고도 에이전트에 영향을 줄 수 있습니다. 명령어 출처: trusted , untrusted external content 또는 mixed 신뢰할 수 없는 콘텐츠가 부작용을 일으키는 행동에 기여한다면 제안된 자원과 주장을 얼어붙이고, 그 콘텐츠 경로 밖에서 정책 결정이나 인적 검토가 필요합니다. 모든 외부 지침을 삭제함으로써 문제를 해결하지 마십시오. 에이전트는 검색된 문서나 도구 출력이 작업하기 위해 필요할 수 있습니다. 보안의 한계는 그 콘텐츠가 조용하게 특권 효과를 선택할 수 있는지 여부에 달려 있습니다. 읽기 전용 분석과 공개 메시지 전송은 동일한 검토 규칙을 공유해서는 안 됩니다. 다음으로, 도구 반응에 따라 독립적으로 효과를 정의하십시오. 정확한 목적지 자원 변경 사항의 최대 수 또는 크기는 되돌릴 수 있는 능력과 역전환 소유자 안정적인 운영 정체성 권위 있는 재검토 또는 다른 결과 증거. 리트레이는 자신의 행을 자격이 있기 때문에 타임아웃은 아무것도 일어나지 않았다는 것을 의미하지 않습니다. AWS 빌더 무능한 API에 대한 라이브러리 가이드는 안정적인 클라이언트 요청 식별자가 반복된 요청을 의미적으로 동등하게 만들 수있는 방법을 보여줍니다. 그 계약은 안전성으로 다시 시도할 수 있도록 지원합니다. 그것은 원래의 동작을 승인하지 않으며, 실행 시기가 두 번째 시도에 대한 새로운 식별자를 생성하면 도움이되지 않습니다. 모호한 시간 종료 후 다음 순서를 사용하세요: 1. 본래의 운용 신원을 유지해야 합니다. 2. 권위 있는 목적지를 검색하는 것 3. 현존하고, 없는, 부분적 또는 알려지지 않은 효과로 분류한다. 4. 계약이 또 다른 시도를 안전하게 만들 때만 다시 시도한다. 5. 최종 시도 후 약속된 결과를 확인합니다. 목적지가 무력도 효과도 제공하지 않는 경우, 올바른 상태는 reconcile before retry 입니다. 그 사람이 필요할 수도 있습니다. 여전히 실종된 운송 증거를 복제된 지불, 메시지, 공개 또는 삭제로 바꾸는 것보다 낫습니다. 9번의 위협 리더를 다시 재생하세요 그 부착 장치로 결정 규칙이 검사될 수 있게 됩니다. security risk cases.json 에는 9개의 제안된 작업이 포함되어 있습니다. evaluate ai agent threat ledger.mjs 는 일정 순서로 경계를 확인합니다. 1. 자격증 존재, 만료, 공유, 취소 및 관객 2. 필요한 범위가 부여된 범위와 비교되는 범위; 3. 비 신뢰성 있는 명령어 출처 4. 자원 및 최대 효과 정의 5. 운용 정체성, 무력성 및 재실험 전에 조화 6. 독립적인 효과 증거. 다음으로 실행하세요: 복제된 요약은 다음과 같습니다. 두 개의 사건만 진행됩니다. 하나는 제한된 읽기입니다. 다른 하나는 정확한 청중, 정확한 범위 집합, 이름의 자원, 최대 영향력, 독립적인 증거와 함께 무능한 글입니다. 나머지 사례는 공유 관리자 인증서, 만료된 작업 토큰, 과잉 삭제 범위, 검토되지 않은 외부 명령어, 무제한 수출, 새로운 운영 아이덴티티를 다시 시도하고 효과 증명없이 성공 응답을 보여줍니다. 질서가 중요해요 인증 청중 앞에서 허가를 확인하면, 크로스 서비스 토큰은 그 범위가 일치하기 때문에 안전하다고 보일 수 있습니다. 재시험 신분 확인 전에 효과 증거가 확인되면, 사업자는 다른 안전하지 않은 시도가 이미 가능할 때 실행이 단지 불완전하다는 것을 표시할 수 있습니다. 첫 번째 안전하지 않은 신뢰 경계는 성향을 결정해야 합니다. 당신의 실제 범위와 효과에 맞게 장치를 조정하십시오. 부실된 취소 경로, 잘못된 환경, 노후 승인, 리소스 대체, 부분 작성, 롤백 실패, 도구 출력 및 목적 상태 사이의 불일치를 추가합니다. 목표는 모든 공격을 예측하는 것이 아닙니다. 그것은 권위와 불확실성을 하나의 녹색 요원 상태 안에서 숨기는 것이 불가능하게 만드는 것입니다. 위협 모델이 작동하도록 유지 도구, 범위, 인증서 발행자, 목적지 API, 재시행정책 또는 명령원본이 변경될 때 리저를 검토하십시오. 모든 실행에 대한 완전한 워크숍이 필요하지 않습니다. 도구 계획, 정체성 메타데이터, 정책 및 운영 영수로부터 대부분의 필드를 생성하고, 코드가 해결할 수 없는 영향이나 불확실성에 대해 한 사람에게 물어보십시오. 콤팩트 결정 규칙은 정체성이 청중에 제한되어 있을 때만 진행하고, 권한이 필요한 집합과 같을 때, 신뢰할 수 없는 명령은 침묵으로 효과를 승인 할 수 없으며, 영향이 제한되어 있으며, 재시행은 운영 정체성을 보존하고, 목적지는 결과를 증명할 수 있습니다. 이 규칙에는 한계가 있습니다. 메타데이터는 거짓이나 노후화될 수 있습니다. 정확한 범위는 여전히 위험한 논쟁을 허용할 수 있습니다. 무능력이 만료될 수 있습니다. 다시 읽기 채널은 작가가 손상될 수 있습니다. 따라서, 이 사본은 모호함을 줄이고, 전체 시스템이 안전하다는 것을 증명하지는 않습니다. 하류 허가, 격리, 감사 로그, 테스트, 그리고 영향에 적합한 사고 대응과 결합합니다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 그것은 기존의 에이전트 실행시간에 대한 건강 계층으로 의도되지만, 생산 에이전트 건강 수집 및 복구는 현재 웹 사이트 저장소에 배송되지 않습니다. 이러한 위협 레지스터 패턴은 현재 운영자가 자신의 실행 시간에 구현할 수 있는 것입니다. Sidewisp이 현재 실시간 에이전트를 보안하거나 모니터링한다는 주장이 아닙니다. 만약 당신이 Sidewisp를 미래의 에이전트 건강 업무 흐름에 대해 평가하고 있다면, 개인 미리보기에 참여하세요. 그 때까지 위협 리저를 도구 경계 근처에 보관하고 알려지지 않은 증거가 사건으로 변하기 전에 행동을 멈추게하십시오.