2026-08-01T14:17:46.213Z
AI 에이전트 가드레일: 4 컨트롤 액션 게이트를 구축
에이전트 도구 호출을 신뢰하기 전에 별도의 정책, 정확한 승인, 실행 제한 및 효과 검증.
AI 에이전트 경호는 하나의 펌프, 하나의 분류자 또는 하나의 승인 버튼이 없어야 합니다. 외부 상태를 변경할 수 있는 에이전트에게는 실질적인 기본값은 4개의 컨트롤 액션 게이트입니다. 액션이 허용되는지 결정하고, 호출자가 정확한 액션에 대한 권한을 가지고 있음을 증명하고, 시도를 묶고, 외부 효과를 확인합니다. 각 컨트롤은 다른 질문에 답합니다. 하나의 safe: true 플래그로 결합하면 에이전트가 차단되었는지, 사람을 기다리고 있는지, 재시험 예산이 부족했는지, 아니면 도구 호출 후 증거가 사라졌는지 여부를 숨깁니다. 그 상태들을 분리시켜 놓으면 모든 휴식을 사고로 취급하지 않으면 시스템이 닫히지 않을 수 있습니다. 정책은 행동의 한계에 먼저, 에이전트가 도구가 할 수 있는 일을 줄여서 시작하세요. 정책 게이트는 구조화된 행동 데이터를 수신해야 하며, 시사만을 수신해서는 안 됩니다. 정책 결과는 allow , deny , 또는 unknown 의 결과물이어야 합니다. Unknown 는 중요합니다. 실종된 분류는 허락이 아니며, allow 또는 deny 에 대한 모호성을 강요하는 것은 모델이 운영자의 이름으로 확실성을 발명합니다. 이 게이트는 또한 도구가 에이전트의 능력 집합에 속하는지 확인해야 합니다. 과도한 기관에 대한 OWASP 지침는 과도한 기능, 권한 및 자율성을 별도의 근본 원인으로 식별합니다. 그 완화 사항은 이에 따라 구체적입니다. 필요한 확장만을 노출하고, 개방형 명령에 비해 좁은 기능을 선호하고, 최소한의 하류 권한을 부여하고 하류 시스템에서 권한을 강화합니다. 그 마지막 경계는 중요합니다. 생산 데이터를 결코 삭제하지 않는 것과 같은 명령은 유용한 맥락이지만, 허가 제어 장치가 아닙니다. 삭제 엔드포인트는 에이전트가 설득력 있는 이유를 제시할 때에도 허가되지 않은 아이덴티티를 거부해야 합니다. 마찬가지로, 읽기 전용 작업 흐름은 자격증을 작성할 수 있는 클라이언트를 수신해서는 안 됩니다. 모델 보호막은 여전히 일을 하고 있지만, 그 시간을 알고 있습니다. OpenAI 에이전트 SDK 문서는 에이전트 입력/출력 경비선을 기능 도구 경비선에서 구별한다. 또한, 대리인이 이미 토큰이나 도구를 실행한 후 평행 입력 보호 선이 종료될 수 있음을 지적합니다. 부작용 경계를 위해 실행 직전에 실제 하스트스트림 권한으로 뒷받침되는 차단 검사를 사용하십시오. 합리적인 결함이: 매개체별 허용 목록 이외의 도구를 거부합니다. 구조화된 행동에서 필요한 범위를 계산하는 것 모델 이외의 범위를 강제하고, 정책 입력이 불완전한 경우 unknown 를 반환합니다. 정책 버전을 기록하고 결정과 함께 행동 소화. 컨텐츠 필터는 이 게이트를 대체하지 않습니다. AWS의 연결 AI 경비 레일 문서는 거부 된 주제, 콘텐츠 필터, 지형 검사, 단어 필터 및 민감한 정보 제어, 동시에 구성 제한 및 지연 타협을 문서화합니다. 이러한 방안은 입력과 출력에 유용한 방안입니다. 그들은 공개, 결제, 메시지 또는 파일 돌연변이가 허가된 것을 증명하지 않습니다. 대화가 아니라 한 가지 행동으로 승인 을 묶어 승인된 것은 실행하기에는 너무 모호하다. 안전 승인은 검토된 사람이 정확히 수행한 행위에 연결된 짧은 기간의 당국의 봉투입니다. 최소한, 계속하라: 실행 직전부터 행동 소화가 재조정됩니다. 자원, 주장, 행위자, 도구, 영향 또는 만료가 다르다면 승인이 일치하지 않습니다. 새로운 일에 대해 오래된 결정을 내리는 대신 다시 물어보십시오. 이것은 조용하지만 심각한 실패를 방지합니다. 한 사람이 한 저장소에서 출시를 지원하는 후보를 승인할 수도 있고, 그 후 에이전트의 맥락이 변경될 수도 있고, 다른 주장을 재구성할 수도 있고, 다른 실행은 동일한 대화 상태를 재사용할 수도 있습니다. 자유로이 떠 있는 볼리안은 세 가지 오류를 모두 극복합니다. 액션 결제 영수증은 그렇지 않습니다. 또한 승인이 필요하고 재사용 가능한 상태가 필요합니다. awaiting approval 는 stuck 가 아닙니다. 그것은 이름 지어진 결정, 올바른 사람에게 가는 경로, 만료가 있습니다. 결정이 끝나면, frozen action envelope에서 재개하는 것이 아니라 계획을 다시 실행하고 모델이 동일한 동작을 제안하기를 희망합니다. 모든 행동이 인간에게 필요한 것은 아닙니다. 임팩트를 사용하여 결정합니다. 읽기 전용, 되돌릴 수 있는, 범위가 낮은 활동은 상임 정책으로 진행될 수 있습니다. 제한된, 잘 검증된 역전환의 변경은 명시적인 제한과 감사를 사용할 수 있습니다. 공공적, 재정적, 파괴적, 특권 변경 또는 기타 큰 영향을 미치는 행위는 정확한 승인을 필요로 한다. 타격 경로에 대한 모호함 따라서 인간 검토는 스택 내부의 하나의 통제입니다. 스택 자체는 아닙니다. 허가 후에도 집행이 제한된다 허용되고 승인된 행위는 여전히 나쁜 결과를 초래할 수 있습니다. 집행자는 엄격한 한계를 필요로 합니다. 에이전트가 침묵으로 재협상할 수 없습니다. 모든 시도 전에 검증된 절대 한 가지 제한 기간; 최대 시도 수 부작용에 대한 무력성 키 자원 및 영향 천장 취소 경로 그 결과가 모호하게 되면 어떤 일이 일어날지에 대한 규칙입니다. 반복 시도를 통해 운영 정체성은 안정적으로 유지되어야 합니다. 목적지가 변경된 후 운송 시간 종료가 발생하면 새로운 운용 신원을 발급하는 것은 그 효과를 복제할 수 있습니다. 목적지가 idempotency를 지원하는 경우 동일한 키를 재사용하십시오. 만약 그것이 권위 있는 검색을 제공한다면, 다시 시도하기 전에 화해하십시오. 만약 둘 다 존재하지 않는다면, unverified 를 그만두고 또 다른 시도가 안전하다고 생각하기 보다는 실행자 상태를 기계적으로 유지하십시오. 모델은 재시험을 추천할 수 있지만 코드는 attempt < maxAttempts , 날짜가 신선하고 리소스가 여전히 일치하고 액션에는 사용할 수 있는 자유성 키가 있는지 결정해야 합니다. 이것은 지루한 조건이 딱 맞는 드문 곳 중 하나입니다. 제한은 손상을 억제하는 데만 국한되지 않습니다. 진단을 유지합니다. 그 없이 반복된 호출은 지속성처럼 보일 수 있고, 종료된 작업은 느린 진행처럼 보일 수 있고, 복제된 효과는 회복처럼 보일 수 있습니다. 명시적인 경계로, 운영자는 작업, 대기, 차단 및 불확실한 상태를 구별할 수 있습니다. 독립적으로 효과를 확인 도구 반응은 도구가 보고한 것을 증명하는 것이 아니라 사용자가 필요로 하는 것을 증명합니다. 마지막 문은 관찰 가능한 후상태와 약속된 결과와 비교합니다. 결정론적 증거를 선호합니다. 생성된 객체를 안정적인 ID로 가져오십시오. 목적지 지점 또는 방출 기록을 읽으십시오. 예상 파일의 존재와 해시 일치 여부를 확인한다. 관련 테스트를 수행하고, 의도된 목적지에 메시지가 표시되는 것을 확인합니다. 정확한 자원의 전과 후 값을 비교한다. 같은 약한 신호를 두 번 사용하지 마십시오. 쓰기 엔드포인트가 { "ok": true } 를 반환하면 해당 필드를 완료 기록에 복사하는 것은 독립적인 검증이 아닙니다. 권위 있는 목적지에서 읽거나 약속된 배달 상품을 확인하세요. 어떤 결과는 즉시 확인할 수 없습니다. 통보가 받아들여질 수 있지만 전달되지 않을 수도 있고, 외부 제공자는 읽기 API가 부족하거나 관측 채널이 노후화될 수도 있습니다. unverified 로서, 실종된 증거와 다음 안전 검사를 포함하고, 성공을 보고하는 것을 피하십시오. 이 곳에서 운영 건강과 보안이 만나게 됩니다. 정책과 승인은 금지된 행동을 방지하고 효과 검증은 잘못된 완료를 방지합니다. 에이전트는 모든 접근 규칙을 준수하고 여전히 그 임무에 실패할 수 있습니다. 반대로, 성공한 결과는 허가되지 않은 길을 용서하지 않습니다. 디자인을 신뢰하기 전에 9개의 케이스를 다시 재생하세요 이 유물은 네 개의 컨트롤을 작은 실행 가능한 테스트로 만듭니다. guardrail cases.json 에는 9개의 제안된 조치들이 포함되어 있습니다. evaluate agent guardrails.mjs 는 고정된 우선순위를 적용합니다. 1. 정책 2. 범주 및 승인 기관 3. 집행 제한; 4. 효과 증거. 다음으로 실행하세요: 복제된 요약은 다음과 같습니다. 흥미로운 사례는 순수한 통과나 명백한 부정이 아닙니다. 한 가지 승인이 만료되었습니다. 또 다른 행동의 지문으로 발급되었습니다. 한 글은 재시험 예산을 다 채웠어요. 하나의 명령은 관찰할 수 있는 효과 없이 실행되었습니다. 하나의 정책은 전혀 그 행동을 분류할 수 없습니다. 이 사건들은 국가적 우선순위가 명백하게 있어야 하는 이유를 보여준다. 먼저 효과 증거를 확인하고 허가되지 않은 행동이 검증되지 않은 것으로 표시될 수 있습니다. 정책 전에 승인 확인하고 당신은 사람이 사용할 수 없어야 할 도구를 승인하도록 요청할 수 있습니다. 알려지지 않은 신호를 부정으로 붕괴시키고 운영자가 복구 가능한 데이터 품질 신호를 잃게 됩니다. 허용하는 신호로 붕괴하면 시스템이 권한을 발명합니다. 장비를 자신의 도구에 맞춰서 리소스 교체, 범위를 잃는 경우, 재사용 승인 비효율, 노후 정책 버전, 만료 기간, 부분 효과, 역전 실패, 도구 응답에 동의하지 않는 검증 채널을 추가합니다. 그 실패가 당신이 의도한 상태와 다음 행동을 만들어낼 때만 문이 준비됩니다. 경계를 정직하게 유지하라 AI 에이전트 경호는 각 통제자가 자신의 이유 때문에 소송에 거부권을 행사할 수 있고 그 결정에 대한 증거를 노출시킬 수 있을 때 작동합니다. 콤팩트 규칙은 정책은 그 행위가 속하는지 여부를 결정합니다. 권위는 누가 정확히 무엇을 할 수 있는지 구속합니다. 제한은 시도를 제한합니다. 검증은 효과를 증명합니다. 이것은 분류자를 추가하는 것보다 더 많은 비용입니다. 정확한 승인은 대기 시간을 더합니다. 읽기 후 쓰기 체크는 전화를 더합니다. 좁은 도구는 공학이 필요합니다. 알려지지 않은 국가들은 운영자 처리가 필요합니다. 이 무역은 부작용에 가치가 있습니다. 왜냐하면 모호함이 침묵하는 권위나 거짓의 성공이 아닌 눈에 띄기 때문입니다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 그것은 기존의 에이전트 실행시간에 대한 건강 계층으로 의도되지만, 생산 에이전트 건강 수집 및 복구는 현재 웹 사이트 저장소에 배송되지 않습니다. 여기서 제어 스택은 지금 테스트 할 수 있는 구현 패턴입니다. Sidewisp이 현재 실행하고 있다고 주장하는 것이 아닙니다. 만약 당신이 Sidewisp를 미래의 에이전트 건강 업무 흐름에 대해 평가하고 있다면, 개인 미리보기에 참여하세요. 그 동안, 액션 봉투와 그 증거들을 자신의 실행 시간에 보관하십시오. 가장 안전한 보호 선은 모델이 확실하게 잘못되었을 때 여전히 유지되는 것입니다.