2026-08-01T14:17:52.805Z

LLM 자기 평가: 자신 을 신뢰 하기 전 에 판사 를 조정 하십시오

각 판결을 결정적인 증거, 기준에 맞게 정렬된 LLM 판사, 또는 책임있는 인간 검토로 안내하십시오.

LLM 자기평가는 기준이 진정으로 양성적이거나, 평가자가 정확히 그 기준에 대한 인간 표지에 대한 테스트를 받았을 때 유용하며, 그 답은 뒷받침 증거로 간주됩니다. 이 법은 파일이 존재하는지, 결제가 도착했는지, 시험이 통과했는지, 또는 돌이킬 수 없는 조치를 허가한 사람이 있는지 결정해서는 안 됩니다. 이러한 질문들은 이미 더 강력한 소유자를 가지고 있습니다. 결정적인 통제 또는 책임있는 인간입니다. 따라서 실질적인 기본값은 로우터이며, 보편적인 판사가 아닙니다. 기계적으로 확인할 수 있는 주장을 코드에 보내십시오. 한정된 질적 기준을 캘리브레이션 모델 평가자에게 보내십시오. 드러나지 않은, 불안정하거나 큰 영향을 미치는 결정을 사람에게 보내십시오. 증거가 없어진다면, 판결은 unknown 로 유지하세요. LLM 판사는 권위 있는 사람이 아니더라도 유용할 수 있습니다. 자기 평가란 LLM에 자신의 출력을 평가하거나 다른 모델의 출력을 요청하는 것을 의미합니다. 두 번째 패스는 명백한 모순을 파악하거나 두 개의 요약을 비교하거나 항목에 대한 응답을 평가할 수 있습니다. 프팅 의 개요 를 배우십시오는 기본 패턴을 보여줍니다: 답을 생성하고, 모델을 비판하거나 수정하도록 요청합니다. 연구에 따르면 이 패턴은 믿을 수 있지만 제한된 역할을 합니다. 렌과 동료는 오픈 엔드 자부 평가를 토큰 수준의 예측으로 재설정하고 테스트 된 PaLM 2 및 GPT 3 설정에 대해 TruthfulQA 및 TL;DR에서 선택형 생성 정확성과 출력 품질과 더 강한 상관관계를 보고했습니다. 다단계 작업에 대한 최근의 연구는 단계적 자기평가가 두 개의 벤치마크 데이터 세트에서 실패 검출을 위한 전체적인 점수를 우월한 것으로 나타났으며, AUC ROC의 상대적인 증가율은 최대 15%까지 증가했다. 그 결과 양쪽 모두 모델 의견이 배달 영수증으로 변하지 않습니다. 그들은 자기 평가가 특정 과제, 명령어, 모델 및 데이터 집합에 따라 결정을 향상시킬 수 있음을 보여줍니다. 신뢰 단위는 테스트된 평가자 구성입니다. "LLM 판사"라는 표현이 아닙니다. 또한 알려진 실패 모드가 있습니다. MT Bench와 Chatbot Arena의 논문은 강력한 판사들이 80% 이상의 인적 선호에 대한 동의에 도달했다고 보고하며, 입장, 말 그대로, 자기 증진 및 추론 편향을 기록하고 있습니다. 합의는 격려적입니다. 편견 목록은 운영적으로 결정적입니다. 판사는 평균적으로 유용하지만 여전히 중요한 단 하나의 판결을 뒤집을 수 있습니다. 위치 편향은 쉽게 테스트 할 수 있습니다. A와 B 후보자를 평가하고, 내용을 변경하지 않고 주문을 교환하고 다시 평가합니다. 왕과 동료는 순서 변경이 쌍방향 순위를 실질적으로 변경할 수 있음을 보여주었고 균형 위치 캘리브레이션과 인적 격화를 제안했습니다. 교환 후 선호하는 후보자가 변경되면 unstable 를 기록하십시오. 모순을 자신감 넘치는 점수로 평균하지 마십시오. 판사를 정렬하기 전에 기준을 동결하십시오. "품질"은 측정하기에는 너무 넓습니다. 명확한 요약을 인정하는 판사는 여전히 사실적 근거, 정책 해석 또는 증거 부족에 대한 신뢰성이 떨어질 수 있습니다. 좁은 계약으로 한 가지 기준을 정의하십시오. 캘리브레이션 세트는 평가자가 작성하지 않은 예제, 기준을 소유한 사람들의 레이블, 그리고 칭찬하거나 지나치게 허용적인 등급을 노출시킬 만큼 어려운 부정적인 요소가 필요합니다. 모델 식별자, 판사 프롬프트, 라브리크, 예제, 출력 파서 및 임계값을 함께 얼어붙이십시오. 그 중 어느 하나에 대한 변경은 새로운 평가판을 만듭니다. 이 과정에서 인간 표지가 부끄러운 것은 아닙니다. 그들은 목표를 정의합니다. 에발겐의 저자는 "기준 유동"을 설명합니다. 사람들은 실제 출력을 보았을 때 종종 기준으로 무엇을 의미하는지 정밀화합니다. 이것은 버전 기준과 표기 의 이유 입니다. 모델 점수 뒤에 판단을 숨기기 위한 이유 아닙니다. 기준에 따라 적어도 이러한 성질을 측정한다. 수직된 인간 표지판에 대한 협정 잘못된 합격률, 왜냐하면 잘못된 출력을 승인하는 평가자가 잘못된 성공을 창출하기 때문입니다. unknown 비율, 실종된 커버링을 나타냅니다. 후보 순서 및 무관한 포맷 변경 시 안정성; 언어, 작업 가족, 영향 클래스 및 출력 길이를 기준으로 커버링 다음 검토에 대한 예로 남아 있는 의견 충돌 클러스터. 관련 없는 기준을 한 가지 안심하는 평균으로 결합하지 마십시오. 명확성이 100% 동의하고, 근거성이 75%이고, 안전성은 두 가지 예만을 가지고 있다고 가정해 봅시다. 88%의 융합 점수는 방어 가능한 안전 게이트가 없다는 것을 숨길 수 있습니다. 세 줄이 따로 두어 문턱은 정책 선택이고 논문에서 나오는 일정값이 아닙니다. 팀이 저 영향 스타일 제안에 대해 80%의 동의를 받아 들일 수 있으며 배포 효과에 대한 결정적 증거가 필요합니다. 중요한 속성은 석방 후보자가 점수를 받기 전에 문턱이 얼어붙는 것입니다. 캘리브레이션 게이트를 다시 재생 다음 장치에는 네 가지 기준과 8개의 라우팅 케이스가 사용된다. 그 문턱은 의도적으로 간단합니다. 적어도 세 가지 인간 표기된 예제, 적어도 80%의 동의, 그리고 순서 반전에서 승자가 변하지 않습니다. 결정 규칙은 작습니다. 전체 장치를 실행하여: 이 재생은 다음과 같은 결과를 낳습니다. 두 가지 관측은 콤팩트 숫자보다 더 중요합니다. 첫째, 그 장비에는 판사가 pass 라고 부르는 실종된 서류가 포함되어 있습니다. 라우터는 결정적인 fail 를 반환합니다. 또한 판사가 싫어하는 체크섬 매치를 포함하고 있으며 라우터는 결정적인 pass 를 반환합니다. 모델은 프레젠테이션에 대해 언급할 수 있지만 약속된 객체가 존재하는지 일치하는지 여부에 대한 증거를 무시하지 않습니다. 둘째, 쌍방향 품질은 4개의 표기된 예제에 대해 완벽한 동의를 가지고 있지만 후보자가 순서를 교환할 때 승자를 변경합니다. 게이트는 여전히 실패하고 있습니다. 역사적인 합의는 현재의 모순을 배제하지 않는다. 이 작은 재생은 여러분의 응용 프로그램에 80% 안전하다는 증거가 아닙니다. 그것은 모든 판결이 올바른 증거 소유자에게 도달했다는 것을 증명하기 위해 검사 할 수있는 패턴입니다. 가장 강력한 증거 소유자에게 실시간 결정을 전달하십시오 캘리브레이션이 끝나면, 실행 시간 결정은 3개의 라인을 보존해야 합니다. Deterministic lane. 파일 시스템 검사, 스키마 검증, 테스트 결과, 데이터베이스 제한, 공급자 인수, 서명, 체크섬 및 목적지가 직접 질문에 답할 수 있는 경우 사용하십시오. 관찰된 값과 신선도를 기록하십시오. 0에서 출발하는 명령은 그 명령의 계약만을 증명한다; 의도된 외부 결과를 별도로 확인한다. 판사 지원 라인. 가등성, 관련성, 음색 또는 라브릭 준수 같은 기준을 위해 고정된 평가자를 사용하십시오. 기준, 평가자 버전, 프롬프트 해시, 입력 참조, 판결, 설명 및 캘리브레이션 세트 버전을 유지하십시오. 모델은 판결을 뒷받침하고 그 증거가 허용하는 것을 주변 정책이 결정합니다. Human review lane. 노선은 큰 영향을 미치는 의견 충돌, 새로운 언어, 밝혀진 작업 가족, 질서 불안정성, 정책 예외 및 돌이킬 수없는 권위입니다. 모순적 인 증거 와 구체적 질문 을 포함 하십시오. "제회 검토 부탁드립니다"는 약한 라우팅입니다. "심판사가 완료한다고 말할 때 결정적 인 영수증이 없어지고 있습니다. 이 사건은 종료될 수 있습니까?"는 행동 할 수 있습니다. unknown 결과는 유용합니다. 이 시스템은 현재 이 주장을 입증할 수 없다고 합니다. 알려지지 않은 것을 통과시키는 것은 단순히 래시보드를 불완전하게 보이게 하는 것을 보호하는 것입니다. 캘린더에만 적용하지 않고, 파동에 따라 재계산 판사는 모델 alias가 변경될 때, 프롬프트가 편집될 때, 예제들이 재편될 때, 새로운 언어가 도착할 때, 출력들이 길어질 때, 또는 제품이 다른 작업 가족을 처리하기 시작할 때 유도할 수 있습니다. 해당 변경 사항에 대한 재계급을 촉발하고 예정된 검토 사이에 생중계 불일치 샘플을 모니터링합니다. 두 가지 경계를 가시하게 유지하세요: 1. 자기 평가는 한정된 질적 특성을 추정한다. 그것은 접근성, 유용한 진보, 도구 효과, 메모리 지속성, 또는 전달 가능한 존재를 증명하지 않는다. 2. 평정된 평가자는 검토의 부담을 줄이고, 비밀, 지출, 출판, 삭제, 또는 다른 돌이킬 수 없는 행위에 대한 인간의 권위를 받지 않습니다. 결과는 AI 평가의 덜 극적인 형태입니다. 판사는 유용한 직업을 얻습니다. 결정적인 증거는 더 강력한 역할을 유지합니다. 그리고 사람들은 그들에게 속한 결정을 유지합니다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 기존의 에이전트 런타임에 대한 건강 계층으로 개발되고 있지만, 현재 웹사이트 저장소에 생산 에이전트 건강 수집 및 복구가 전송되지 않습니다. 이 증거 로우팅 문제는 당신이 에이전트를 운영하는 방식과 일치한다면, 생중계 통합의 주장으로 기사를 취급하지 않고 개인 미리보기 대기 목록에 가입할 수 있습니다.