2026-07-31T12:17:01.091Z
다중 에이전트 AI 시스템의 대화형 디버깅 및 조정: 모든 재설정 게이트
다중 에이전트 되감기 및 편집을 체크포인트 적용 범위, 효과 조정, 승인 및 새로운 결과 영수증을 통해 감사 가능한 분기로 전환합니다.
다중 에이전트 AI 시스템의 대화형 디버깅 및 조정을 스크립트 편집으로 취급해서는 안 됩니다. 안전한 재설정은 자체 계보, 복원된 상태 증거, 권한 기록 및 결과 영수증을 갖춘 새 분기를 생성합니다. 브라우저, 작업 영역, 대기열, 자격 증명 또는 외부 대상을 복원하거나 조정할 수 없는 경우 "준비"가 아닌 올바른 상태가 불확실합니다. 이것이 바로 실천에서 얻을 수 있는 교훈이다다중 에이전트 AI 시스템의 대화형 디버깅 및 조정, 뒤에 있는 CHI 2025 논문Microsoft의 오픈소스AGDebugger. 연구에 따르면 다중 에이전트 디버깅에 되감기 및 편집을 사용할 수 있습니다. 운영 배포에는 경계가 하나 더 필요합니다. 재설정을 통해 가설을 테스트할 수 있을 만큼 내부 상태를 다시 생성할 수 있지만 자동으로 이메일 실행 취소, 티켓 되돌리기, 페이지 게시 취소 또는 새 분기가 사용자 작업을 완료했음을 증명할 수는 없습니다. 합리적인 기본값은 6개의 게이트가 있는 스티어링 영수증입니다. 1. 부모와 지점은 서로 다른 정체성을 가지고 있습니다. 2. 체크포인트에는 필요한 모든 에이전트 및 도구 상태 키가 포함됩니다. 3. 체크포인트 이후의 효과는 되돌리거나 조정됩니다. 4. 운영자는 개입할 권한이 있습니다. 5. 에이전트 구성이 새 분기에 고정됩니다. 6. 재개된 브랜치는 새로운 결과 영수증을 받습니다. 처음 5개만 분기를 재개 준비 상태로 만듭니다. 여섯 번째는 이를 검증 하게 만듭니다. 재설정은 되감기가 아닌 분기입니다. 그만큼AGDebugger종이는 구체적인 문제에서 시작됩니다. 5명의 에이전트 개발자는 긴 대화에서 오류 위치 파악의 어려움, 대화형 디버깅 제어 누락, 에이전트 구성의 느린 반복에 대해 설명했습니다. 작성자는 개발자가 메시지를 단계별로 살펴보고, 이전 지점으로 재설정하고, 이전 메시지를 편집하고, 결과 대화 분기를 비교할 수 있는 시스템을 구축했습니다. 14명의 참가자를 대상으로 한 두 부분으로 구성된 연구에서는 진단 및 조정 전략을 조사했습니다. 이는 로그 검색보다 더 강력한 상호작용입니다. 개발자는 실패 경계에서 두 가지 위조 가능한 질문을 할 수 있습니다. 즉, 동일한 상태가 다시 실행되면 어떻게 되는지, 그리고 특정 메시지가 변경되면 어떻게 됩니까? 이 논문에서는 세부 사항 추가, 작업 단순화, 계획 변경이라는 세 가지 일반적인 조정 형태를 보고합니다. 그러나 구현 세부 사항은 편집 어포던스보다 더 중요합니다.AGDebugger메시지가 처리되기 전의 검사점 에이전트 상태입니다. 재설정 시 해당 체크포인트를 복원하고 새 세션을 생성합니다. 포크 이전의 메시지와 체크포인트는 계속 공유됩니다. 새 메시지와 체크포인트는 지점에 속합니다. 인터페이스가 되감기처럼 보이더라도 그것은 계보입니다. 연산을 분기로 처리하면 연산자에 세 가지 유용한 불변이 제공됩니다. 원래 실패한 실행은 검사 가능한 상태로 유지됩니다. 정확한 분기점은 변경할 수 없습니다. 편집 내용과 이후의 모든 효과는 새 세션에 속합니다. 이러한 불변성이 없으면 편집된 기록을 통해 사건을 진단하는 데 사용되는 증거를 다시 작성할 수 있습니다. 결과적인 "성공적인 실행"은 어떤 기록, 프롬프트, 도구 스키마 또는 모델 구성이 생성되었는지 알 수 없기 때문에 재현이 불가능할 수 있습니다. 지점 레코드에는 메시지 내용이 필요하지 않습니다. 해시 식별자와 대략적인 편집 클래스는 증거 추적에 충분합니다. 단지 포크가 존재한다는 것을 증명하기 위해 프롬프트, 도구 인수, 비밀 또는 사용자 데이터를 내보내지 마십시오. 계획을 변경하기 전에 주 적용 범위를 복원하십시오. 기록에서 메시지를 삭제하는 것은 상태 복원이 아닙니다. 종이는 말한다AGDebugger에이전트는 상태 저장 및 로드 방법을 구현합니다. 웹 에이전트의 상태에는 URL 및 뷰포트 위치가 포함될 수 있습니다. 다른 에이전트에는 다른 상태가 필요할 수 있습니다. 또한 브라우저 JavaScript 및 원격 애플리케이션 상태를 완전히 복원하는 것은 비실용적이거나 불가능할 수 있으므로 체크포인트 정책을 "충분히 좋다"고 설명합니다. 이러한 제한은 사후 분석이 아닌 재설정 버튼 옆에 있어야 합니다. 실행이 시작되기 전에 워크플로에 필요한 상태 키를 정의합니다. 소규모 연구 및 출판 팀의 경우 다음과 같을 수 있습니다. 승인 대기열이 없기 때문에 이 체크포인트는 완료되지 않습니다. 기록 재생으로 인해 지점에서 다시 질문하거나, 기존 결정을 건너뛰거나, 권한이 인계된 것처럼 행동할 수 있습니다. 운영자가 봐야지 restore uncertain , 녹색 이력서 컨트롤이 아닙니다. 보장은 필요하지만 충분하지는 않습니다. 모든 상태 키에 대해 개정 또는 내용이 없는 지문과 복원 결과를 기록합니다. 상태 키 재설정 전 증거 필수 복원 테스트 에이전트 메모리 개정 및 체크포인트 해시 로드된 개정판이 포크와 일치합니다. 브라우저 출발지, 경로 해시 및 로컬 세션 클래스 예상 경로에 도달할 수 있고 세션 클래스가 유효합니다. 작업공간 저장소 커밋 및 더티 상태 다이제스트 정확한 개정과 의도적인 로컬 변경 도구 레지스트리 스키마 해시 및 기능 수 현재 레지스트리 일치 또는 드리프트가 확인되었습니다. 승인 대기열 결정 접수 ID 및 상태 보류 중인 결정과 해결된 결정은 보존됩니다. 체크포인트 이후 실시간 원격 시스템이 이동되었을 수 있습니다. 그것이 항상 실패하는 것은 아닙니다. 증거에 라벨을 붙이는 이유가 됩니다. 브라우저가 기록된 페이지로 돌아갈 수 있지만 페이지의 기본 기록이 변경된 경우 스냅샷 충실도는 부분적입니다. 운영자는 여전히 진단 분기를 실행할 수 있지만 이를 정확한 재생으로 표시해서는 안 됩니다. 구성은 상태의 일부입니다. 지점에서 사용하는 상담원 역할, 모델 식별자, 도구 세트, 시스템 프롬프트 및 라우팅 규칙을 고정합니다. 그렇지 않으면 성공적인 편집은 일부 알려지지 않은 조합이 작동했다는 것만 증명합니다. 원래 구성을 변경할 수 없도록 유지하고 의도적인 델타를 기록합니다. 도구 호출을 재생하기 전에 효과 조정 체크포인트는 디버거의 제어에 따라 상태를 복원합니다. 그것은 외부 세계를 뒤집지 않습니다. 상위 지점이 체크포인트 이후에 티켓을 생성한 후 약속된 공개 보고서를 생성하지 못했다고 가정해 보겠습니다. 도구 호출 전에 재설정하고 재생하면 두 번째 티켓이 생성될 수 있습니다. 응답이 없다고 해서 첫 번째 호출이 효과가 없었다는 증거는 아닙니다. 재개하기 전에 외부 효과가 있는 모든 체크포인트 이후 작업을 열거하고 분류합니다. reverted : 원래 효과가 안전하게 취소되었습니다. reconciled : 효과는 유지되고 새 분기는 이를 재사용하거나 건너뜁니다. pending : 목적지 증거가 누락되었습니다. irreversible : 효과는 되돌릴 수 없으며 새로운 인간 결정이 필요합니다. 아무것 pending 또는 irreversible 해당 경계에서 자동 재생을 차단합니다. 대상이 지원하는 경우 안정적인 작동 키를 사용하십시오. 게시 작업의 경우 다른 항목을 만들기 전에 변경할 수 없는 초안 ID로 대상을 쿼리하세요. 이메일의 경우 메시지 본문 없이 공급자 메시지 ID를 유지합니다. 저장소 변경의 경우 예상 커밋 또는 트리 해시를 비교하세요. 티켓의 경우 요청의 멱등성 키로 티켓을 검색합니다. 운영자의 개입에도 권한 경계가 필요합니다. 지점이 지역 설비에 국한되어 있으면 계획 편집의 위험이 낮습니다. 편집으로 인해 수신자, 예산, 권한, 생산 목표 또는 파괴적인 작업이 변경되면 이는 실질적으로 다릅니다. 해당 편집 내용을 승인된 소유자에게 전달하고 분기를 유지합니다. needs approval 결정 영수증이 도착할 때까지. 그 결정을 기다리는 것은 멈추지 않습니다. 권한이나 대상 상태를 알 수 없는 상태에서 반복적으로 재개하는 것은 실패입니다. 불편한 사항에 대비하여 스티어링 영수증 실행 수반되는 아티팩트는 콘텐츠가 없는 고정 장치이자 결정론적 분류자입니다. 실행되지 않습니다AGDebugger또는 사용자 연구를 재현한다고 주장합니다. 재설정과 관련된 운영 결정을 테스트합니다. 로컬에서 실행하세요: 고정물에는 8개의 가지가 있습니다. 생성된 분류자는 다음과 같습니다. 테스트는 아홉 번째 주장을 추가합니다. ID가 상위와 동일한 분기는 다음과 같이 거부됩니다. invalid lineage . 우선 순위는 의도적입니다. 누락된 상태는 연산자가 분기의 시작점을 설정할 수 없기 때문에 해석에 영향을 미칩니다. 승인이 고려되기 전에 조정되지 않은 효과 차단이 재개됩니다. 승인 및 고정된 구성은 분기를 정상 상태가 아닌 준비 상태로 만듭니다. 재개 후에도 예상 결과물에는 여전히 결정론적 검증자가 필요합니다. 필드 하나를 변경하면 결과가 예상대로 움직여야 합니다. 누락된 승인 대기열 키를 부분 복원에 추가하면 진행할 수 있습니다. 보류 중인 티켓 효과가 조정된 것으로 표시하면 지점이 기관 게이트에 도달할 수 있습니다. 세트 outcomeVerified 유창한 최종 답변 후 거짓으로 설정하고 결과는 그대로 유지됩니다. false success . 이로 인해 중요한 운영상의 차이가 발생합니다. "재개 준비 완료"는 개입 경계가 제어됨을 의미합니다. "확인됨"은 새 지점이 의도한 작업을 완료했음을 의미합니다. 해당 주를 하나의 녹색 배지로 병합하지 마십시오. 실험이 증명하지 못한 것 아티팩트는 스냅샷 충실도가 아닌 결정 규칙의 유효성을 검사합니다. 브라우저가 정확히 복원되었는지, LLM이 동일한 경로를 사용하는지 또는 문서화되지 않은 부작용이 발생하지 않았는지 증명할 수 없습니다. 실제 통합에는 런타임별 상태 어댑터와 대상 쿼리가 필요합니다. 그만큼AGDebugger연구에는 또한 제한된 범위가 있습니다. 5명의 형성 인터뷰 대상자, 14명의 연구 참가자, 2개의 연구 과제 및 다음을 기반으로 구축된 연구 프로토타입입니다.AutoGen. 그 결과는 상호 작용 패턴을 정당화합니다. 모든 다중 에이전트 아키텍처에 대해 사고율 감소를 설정하지는 않습니다. 이 문서 자체에서는 에이전트 구현에서 조정을 분리하고 편집 내용이 영향을 미쳤는지 확인하는 등 공개 과제를 식별합니다. 이러한 제한은 운영 규칙을 강화합니다. 확실성을 만드는 것이 아니라 가설을 분리하려면 대화형 재설정을 사용하세요. 상위 항목을 보존하고, 명시적으로 분기하고, 증명할 수 있는 항목을 복원하고, 불가능한 항목에 레이블을 지정하고, 외부 효과를 조정하고, 권한을 요구하고, 대상에서 새로운 결과를 확인합니다. Sidewisp는 현재 비공개 프리뷰 단계입니다.프로덕션 모니터링 어댑터와 복구 실행기는 일반적으로 배송되지 않습니다. 여기서의 방법은 검사 가능한 작동 패턴이지, 다음과 같은 주장이 아닙니다.Sidewisp이미 라이브 에이전트 팀을 체크포인트하거나 조종하고 있습니다.Sidewisp의 제품 방향은 인간의 권위, 증거 및 결과 검증을 안전한 복구의 중심으로 유지합니다. 현재 다중 에이전트 시스템을 운영하고 있다면 오류가 발생하기 쉬운 워크플로부터 시작하십시오. 다음 사건이 발생하기 전에 상태 키와 외부 효과 원장을 정의하십시오. 첫 번째 유용한 체크포인트는 가장 많은 기록을 재생할 수 있는 체크포인트가 아닙니다. 무엇이 복원되었는지, 무엇이 변경되었는지, 누가 지점을 승인했는지, 최종 결과가 어떻게 확인되었는지를 정확하게 설명할 수 있는 사람입니다.