2026-08-01T12:22:32.665Z
AI 요원 과학에 대한 신뢰성: 증거를 감사
논문의 12개 메트릭을 검사 가능한 증거 프로파일로 변환하고,
에 대한 짧은 운영 읽기 ZXQ00001QXZ의 과학에 대한 AI 에이전트 신뢰성 는 다음과 같습니다: 종이 4 차원 프로파일을 유지하지만, 그것을 생산한 증거 없이 12 점수의 행을 결코 받아들이지 마십시오. 배포 결정에, 또한 가용성, 예상 실행, 소유 대기, 도구 효과 및 목적지 결과의 현재 증거를 추가하십시오. 벤치마크 프로파일과 생생한 건강 판결 답변은 서로 다른 질문입니다. 스테판 라반서 및 동료들의 2026년 6월 arXiv v3 논문는 무작위 작업 정확도에 상관없이 신뢰성을 측정합니다. GAIA와 τ 벤치의 청소된 하위 집합에 대한 15 가지 모델을 평가하고, 신뢰성을 일관성, 탄력성, 예측 가능성 및 안전성으로 분해합니다. 저자의 결과는 의도적으로 불편하다: 연구된 출시 창에 대한 능력 증가는 자동으로 비교 가능한 신뢰성 증가를 가져오지 않았습니다. 이는 사업자에게 유용하지만, 각 매트릭을 증거 계약으로 번역한 후에야 가능합니다. 아래의 체크리스트는 그 번역을 수행하고 나머지 생산 경계를 명시적으로 설명합니다. 12개의 메트릭을 증거 요청으로 읽으십시오 논문 s 테이블 2는 12개의 메트릭을 포함합니다. 12개의 교환가능한 품질 포인트가 아닙니다. 크기는 종이 매트릭스 보관해야 할 최소한의 증거 일관성 결과, 궤도 분포, 궤도 순서, 자원 사용 작업 집계 버전, 독립적인 실행 수, 결과 오라클, 액션 순서, 리소스 유닛 및 각 실행 기록 견고함 결함, 환경, 신속함 기본 테스트, 쌍용 혼란 테스트, 버전화된 혼란 사양 및 환경 또는 신속한 변경이 작업의 의미를 보존했다는 증거 예측가능성 기밀; 차별/AUROC; Brier 등급 이전에 확보된 신뢰성, 바이너리 결과 증거, 핑 또는 순위 방법, 샘플 수 및 신뢰의 원천 안전 준수; 피해의 심각성 버전 제한, 각 위반, 심각성 규칙, 판사 신분 및 버전, 그리고 인간 검증 샘플 따라서 첫 번째 운영 규칙은 간단합니다. a 메트릭은 지명자, 프로토콜 및 증거 위치 없이 사용할 수 없습니다. 낮거나 건강하지 않습니다. . 결과의 일관성을 생각해 보세요. 40개의 작업을 5번 반복하면 200개의 테스트를 할 수 있습니다. 하지만 점수를 통해서만 같은 작업이 성공과 실패 사이에 번갈아가는지 또는 고정된 부분 집합이 항상 실패하는지 알 수 없습니다. 이러한 패턴은 비슷한 평균 정확성과 매우 다른 운영 결과를 초래할 수 있습니다. 논문의 메트릭은 그 차이를 드러내기 위해 존재합니다. 시험 수준의 증거를 폐기하면 문제가 해결되는 것을 재현합니다. 강도 측정은 더 많은 주의가 필요합니다. 결함 주입 점수는 기본 기준에 비해서만 해석될 수 있다. 단속성 점수는 변수가 의미적으로 동등한 상태로 유지되는 경우에만 유효합니다. JSON 필드의 이름을 변경하면 환경적 취약성을 테스트 할 수 있습니다. 작업을 해결하는 데 필요한 정보를 제거하면 작업이 변경됩니다. 방해 생성기, 그 버전과 검토된 표본을 결과 옆에 보관하십시오. 예측 가능성은 비슷한 엄격한 시간표가 필요합니다. 성과 평가자가 나오기 전에 자신감을 얻으세요. 에이전트가 테스트 결과를 보았을 때 작성된 자신감은 예측이 아닙니다. 또한 값이 에이전트, 별도의 모델, 캘리브레이션 분류자 또는 유리스틱에서 왔는지 기록하십시오. 캘리브레이션, AUROC, 그리고 Brier 점수는 모두 잘못된 신뢰 신호에서 올바르게 계산될 수 있습니다. 마지막으로, 종이에 대한 안전 경계를 유지하십시오. 그 공공 방법론는 안전성을 종합 신뢰성 점수로부터 분리하여 보고합니다. 이것이 바로 운영에 대한 기본값입니다. 강한 일관성 점수는 허가되지 않은 파괴적인 행동을 평균적으로 볼 수 없습니다. 준수 측정 제한이 얼마나 자주 준수되었는지; 조건적 손해의 심각성은 위반이 얼마나 심각한지 묻습니다. 주파수와 꼬리 둘 다 필요해요 의논하기 전에 프로필을 정리한 것 최저 논리는 증거 패키지가 불완전할 때 조기적입니다. 저는 작은 프로파일 리너를 만들었습니다. 먼저 구조를 확인합니다. 12개의 명칭 매트릭이 모두 존재합니다. 매 매트릭은 점수, 수자, 지명자, 프로토콜 및 증거 URI를 가지고 있습니다. 탄력성 결과는 복제된 기본 라인 및 혼란 수를 더하여 버전된 사양을 포함합니다. 예측가능성 결과는 신뢰의 원천을 확인합니다. 안전성 결과는 제한을 확인하고 판단 방법; 안전은 전체 신뢰성 집합에 접어들지 않습니다. 자율적인 배치에는 비공개인 검증된 안전 샘플이 포함됩니다. 그 다음에는 생체 건강 증거의 여섯 가지 클래스를 검사합니다: 신선함, 접근성, 일정 커버링, 대기 소유, 도구 효과 인수증 및 목적지 결과 인수증. 포함된 일러스트티브 프로파일은 모두 12개의 논문 매트릭과 30건의 인간 안전 검토를 포함하고 있습니다. 그 결과는 여전히: 두 블로커는 도구 효과와 목적지 결과 인증을 놓치고 있습니다. 린터 테스트는 그 다음 두 가지 증거 참조를 제공하고 결과를 PASS 로 변경합니다. 그건 가짜 에이전트가 안전하다는 것을 증명하는 것이 아니라 그 차이점은 중요합니다. 다음으로 감사를 수행합니다. 이것은 의도적으로 소박한 유물입니다. 그것은 존재와 형태를 검증하고 과학적 타당성을 검증하지 않습니다. 그것은 벤치마크가 사용자들을 나타내고 있는지, 신뢰 보고가 정직하고, 두 개의 명령이 같은 것을 의미하는지, 또는 LLM 판사가 피해를 올바르게 평가했는지 결정할 수 없습니다. 그 작업들은 여전히 도메인 검토 작업입니다. 프로파일을 하나의 방출 번호로 바꾸지 마십시오. 논문은 비교를 뒷받침하기 위해 차원 집합을 계산하지만, 그 자체의 선택은 왜 사업자가 프로파일을 가시적으로 유지해야 하는지 보여줍니다. 전체적인 신뢰성 집합은 일관성, 예측 가능성 및 견고성을 결합합니다. 안전은 분리되어 있습니다. 이 논문은 또한 중요한 한계를 명시하고 있습니다. 두 개의 기준은 좁은 작업 조각만을 다루고 있으며, 한 기준에 한 발판이 사용됩니다. 안전 평가는 LLM 판사에 달려 있으며, 측정 및 집합 선택은 주관적이며, 온도 0은 정확성을 극대화하기 위해 선택한 설정에서 사용할 수있는 신뢰성을 과다평가 할 수 있습니다. 이러한 제한은 배치 결정과 함께 표시되어야 하며, 보관된 방법론 메모에 표시되지 않아야 한다. 실용적인 검토는 세 가지 계층을 사용할 수 있습니다. 1. 프로파일 완전성: 12개의 메트릭은 검증 가능한 증거로 뒷받침되는가? 2. 적용률: 이 작업 및 권한 수준에 대해 어떤 차원과 꼬리 조건이 허용되는가? 3. O 운영 증거: 현재 배치된 시스템은 도달 가능하고, 진행되고, 제한되어 있으며, 의도된 외부 결과를 생산합니까? 두 번째 계층은 반드시 응용 분야에 특화된 것입니다. 의무적인 인적 검토를 가진 초안 작성 보조는 감독되지 않은 환불 대리원보다 다른 불일치를 용납할 수 있습니다. 이 논문은 동일한 일반적인 점을 제시합니다. 신뢰성 요구 사항은 자율적으로 확장되어야 합니다. 리더보드 점수를 보편적인 출시 문턱으로 복사하는 것을 피하십시오. 그 결과 부작용을 위해서는 평균보다 먼저 거부권을 사용한다. 합리적인 지역 정책 중 하나는 이런 순서로 매력적인 평균은 알려지지 않은 상태나 심각한 상태를 숨기지 않습니다. 가공에서 측정한다고 주장하지 않는 생산 증거를 추가합니다 벤치마크는 정의된 프로토콜에 따라 행동을 평가합니다. 운영자는 지금 무슨 일이 일어나고 있는지 알아야 합니다. 이 6개의 영수증을 추가로 추가된 종이 메트릭이라고 하지 않고 추가합니다. E 증거 신선성: 각 건강 신호가 마지막으로 확인된 시점과 그 유효기간이 만료되는 시점. 접근성: 실행 시간 및 필요한 도구는 지금 연락할 수 있는지 여부 예정 커버리: 예상 경주 시작, 완료, 초복 또는 놓친. 소유권: 합법적인 의존성이 소유자, 임기 및 재개 가능한 상태를 가지고 있는지 여부를 기다립니다. 도구 효과 조화: 시간 정지 또는 재시험된 동작이 목적지 0, 1 또는 여러 번 변경되었는지 여부를 결정합니다. 목적지 결과 검증: 약속된 파일, 데이터베이스 변경, 메시지, 테스트 결과 또는 다른 배달이 존재하고 그 수용 규칙을 충족하는지 여부를 확인합니다. 이 추가 조항은 두 가지 범주 오류를 방지합니다. 첫째, 반복된 벤치마크의 성공은 현재 생산 실행 시간이 달성될 수 있다는 것을 증명하지 않습니다. 둘째, 성공적인 명령 또는 모델 응답은 외부 효과 또는 전달 가능한 것이 존재한다는 것을 증명하지 않습니다. 프로젝트 사이트에서 연결된 HAL 배너스 저장소는 재생 가능한 평가, 추적, 고립 및 비용 추적을 강조하기 때문에 여기에 유용합니다. 그것은 강력한 평가 입력입니다. 그들은 여전히 배포에 특화된 결과 오라클과 현재 운영 영수증을 필요로 합니다. 에이전트가 벤치마크를 벗어나 행동할 때. 서류를 프로필로 사용하세요. 허가를 위한 서류가 아닙니다. 실제 검토를 위해서는 전체 함대보다는 하나의 작업 흐름으로 시작하세요. 1. 실행 시간, 모델, 스칼프드 컴밋, 도구 버전, 작업 집합 버전 및 평가 날짜를 핑. 2. 반복된 명칭 실험을 실행하고 결과, 궤도 및 자원 기록을 유지하십시오. 3. 결과를 확인하기 전에 오류, 환경, 그리고 즉각적인 혼란을 정의하십시오. 4. 평가를 받기 전에 자신감을 얻으세요. 5. 제한과 심각성 수준을 정의하고, 인간으로 안전 샘플을 검증한다. 6. 안전은 종합으로부터 분리되어 있어야 합니다. 7. 6개의 생체 건강 증거 수업을 연결해 주세요. 8. 증거가 없는 곳마다 unknown 를 기록하세요. 9. 이 작업 흐름의 권위와 결과에 대한 임대 및 거부권을 설정합니다. 10. 재료 모델, 프롬프트, 스카플드, 도구 또는 환경 변경 후 프로필을 다시 실행하십시오. 이것은 논문의 주요 기여를 보존합니다: 신뢰성은 정확성의 동의어가 아닌 형태입니다. 또한 그 모양이 장식용 패시보드로 변하는 것을 막습니다. 검토의 관찰 가능한 결과는 신뢰성 점수가 계산되지 않았습니다. 검증 가능한 증거, 명시적인 알려지지 않은 사항과 당국이 확장되기 전에 확인해야 할 명확한 목록이있는 버전 된 결정입니다. Sidewisp의 의도된 영토는 그 경계의 운영 측면입니다: 접근성, 유용한 진보, 맥락, 도구, 결과, 그리고 다른 곳에서 이미 실행되는 에이전트를 둘러싼 비용. Sidewisp는 현재 비공개 프리뷰 단계입니다. 생산 모니터링 어댑터 및 복구 시스템은 일반적으로 배송되지 않으므로 이 문서에서는 현재 자동화된 Sidewisp 기능이 아닌 운영 방법을 설명합니다. 만약 그 증거 경계가 당신이 잡아야 할 오류와 일치한다면, Sidewisp 사이트에서 개인 미리보기에 가입할 수 있습니다. 출처 Rabanser et al., AI 에이전트 신뢰성의 과학으로, arXiv v3, 2026년 6월 전체적인 에이전트 레이더보드 신뢰성 방법론 HAL 재현 가능한 평가 배너스 ICML 2026 포스터 페이지 OpenReview 기록