2026-08-01T09:31:11.220Z

LLM 평가: 각 결정을 올바른 증거로 향합니다

오프라인 평가, 회귀 게이트, 라이브 품질 검사, 런타임 건강 및 결과 검증을 한 녹색 점수가 깨진 결과를 숨기기 전에 분리하십시오.

LLM 평가는 모델에 의해 작동하는 시스템이 정의된 목표에 대한 정의된 기준을 충족하는지 여부를 테스트하는 관행입니다. 유용한 기본은 간단합니다. 먼저 결정을 명명하고, 그 결정을 뒷받침할 수 있는 가장 좁은 증거를 수집합니다. 큐레이션된 데이터 세트는 사전 발매 품질 주장을 뒷받침할 수 있습니다. 기본 기준 비교는 회귀 결정을 뒷받침할 수 있습니다. 샘플링된 생산 경기는 라이브 품질의 유동을 나타낼 수 있습니다. 그 중 어느 것도 그 자체로 에이전트가 도달할 수 있고 도구 효과를 완성하거나 약속된 유물을 전달했다는 것을 증명하지 않습니다. 그 경계는 중요해요. 왜냐하면 평가가 통과된 것은 그보다 더 넓어보이기 때문입니다. 스코어에는 항상 목표가 있고 시계 있고 증거가 없어집니다. 이를 보편적인 건강 판단으로 취급하면 잘못된 녹색을 만들어냅니다. 그 반응은 좋은 것처럼 보이지만 그 과정이나 결과는 깨집니다. 결정부터 시작하세요, 메트릭은 아닙니다. 정확한 경기, 임베딩 점수, LLM 판사 또는 플랫폼을 선택하기 전에 다음과 같은 문장을 작성하십시오: 에 이번엔 , 결정 이 조치 에서 이 목표 사용 이 증거 . 그 문장은 작업을 가로막는 방향으로 이끄는 것입니다. 결정 목표 시계 최소한의 증거 가장 강력한 지지를 받을 수 있는 주장 후보가 충분히 좋은가요? 큐레이션 된 예제 배포되기 전 데이터 세트, 작업별 점수 지원자는 이 데이터 집합에 해당하는 지정된 기준을 충족합니다. 방출이 줄어들었나요? 기본 기준 및 후보자 방출 시 복합 경주, 임계 지원자는 명명된 회귀 한계를 넘지 않았다 라이브 품질이 떨어지고 있습니까? 샘플링된 생산 경주 교통 중에 신선한 샘플, 생산 평가자 이 표본은 라이브 기준을 충족하거나 놓치고 있습니다. 에이전트가 건강해? 운행 시간 및 예상 업무 예상되는 운행 시간 심장 박동, 일정은, 진전 수표 실행시간은 도달할 수 있고 유용한 작업은 움직이고 있습니다 의도된 결과가 이루어졌는가? 외부 목적지 효력 또는 완공 기간 이후 목적지 인수증, 체크금, 수용 시험 효과 또는 전달되는 것은 존재하고 검증을 통과합니다. 마지막 두 줄은 더 좋은 평가가 아닙니다. 그들은 다른 질문에 대답합니다. 평가자는 응답이나 추적을 검사할 수 있습니다. 운영 건강은 실행되어야 할 프로세스에 대한 증거가 필요합니다. 결과 검증은 결과가 존재해야 할 목적지에서 증거가 필요합니다. 오프라인 평가는 제한된 사전 발매 주장을 지원합니다 OpenAI의 평가 지침는 유용한 작업 흐름을 정의합니다: 목표를 명시하고 데이터 세트를 수집하고 매트릭을 정의하고 비교를 실행하고 시스템 변경에 따라 계속 평가합니다. 또한 일반 측정값과 비브 기반 평가에 대해 경고합니다. 실질적인 의미는 오프라인 스코어에 따라 출시 결정이 필요하다는 것입니다. 지원 에이전트가 올바른 도구를 선택하고 올바른 계정 식별자를 전달하고 정책에 따라 답변을 반환해야한다고 가정합니다. 그 숫자를 평균으로 쪼개지 마세요. 세 가지 검사를 사용하세요: 선택된 도구와 논증에 대한 정확한 검사 또는 스케마 기반 검사; 답변에 대한 작업에 대한 품질 항목; 응용 계약에 의해 요구되는 모든 출력 필드에 대한 결정적 검증이 필요합니다. 그 다음, 같은 경우의 발매 기준과 현재의 후보자를 비교하십시오. 답변 스타일을 개선하지만 계정 ID 정확성을 줄이는 후보자는 0.7% 더 낫지 않습니다. 방출 게이트는 그 거래가 허용되는지 알려야 합니다. 따라서 회귀 테스트는 오프라인 평가의 특정 사용이며 모든 평가의 동의어가 아닙니다. 안정적인 기본 기준, 복합 사례, 그리고 방출 행동과 연결된 임계값이 필요합니다. 데이터 세트 버전, 점수 버전, 모델 및 프롬프트 구성, 샘플 카운트 및 의견 충돌을 기록하십시오. 그 표본이 없으면, 점수 변경은 안전하게 할 수 없습니다. 합리적인 바닥은 작을 수 있습니다. 각 중요한 구성 요소에 대해 신중하게 검토된 5~10개의 사례는 명확하지 않은 수용 기준을 가진 큰 합성 집합보다 더 유용하다. 실제 사건, 가장자리 사건, 리뷰어 의견 차이에서 세트를 확장하십시오. 데이터 세트가 더 어려워져야 합니다. 왜냐하면 시스템이 실패를 가르쳐주었기 때문이 아니라 온라인 평가에서는 더 약한 참조로 실시간 행동을 관찰합니다. 랭스미스의 평가 개념는 중요한 목표 차이를 만듭니다. 오프라인 평가들은 데이터 집합과 예제를 기반으로 실행되며, 종종 참조 출력으로 이루어집니다. 온라인 평가들은 일반적으로 정확한 참조가 없는 생산 라인이나 스레드에서 진행된다. 그 판결의 의미는 달라질 수 있습니다. 온라인 평가자는 안전 패턴, 잘못된 출력, 주제 유동, 낮은 사용자 만족, 또는 비정상적인 궤도를 표시할 수 있습니다. 그것은 또한 오프라인 회귀 집합을 위해 어려운 라이브 사례를 수확 할 수 있습니다. 참고로 뒷받침된 테스트의 신뢰를 침묵으로 물려받을 수 없습니다. 그 표본은 노후화되거나 필터링되거나 비대표적이거나 유도된 판사가 점수를 받을 수 있습니다. 각 온라인 규칙에 대해, 다음을 기억하십시오. 샘플링 정책과 배제 론 또는 스레드 식별자, 민감한 내용이 누출되지 않는 것 평가자 버전과 부문 관측시간과 신선함 창 실패로 인한 행위 인간적인 검토와 의견 충돌을 파악하는 경로입니다. 구글의 에이전트 개발 키트 문서는 도구 사용 궤도의 평가와 최종 응답의 평가를 분리합니다. 그건 유용하지만 궤도를 맞추는 것은 자제해야 합니다. 두 개의 유효한 에이전트는 서로 다른 도구 순서를 통해 동일한 작업을 해결할 수 있습니다. 정확한 궤도 일치는 안전 계약의 일부인 경우 적절합니다. 그렇지 않으면 하나의 이상적인 경로를 요구하기보다는 필요한 효과와 금지된 행동을 확인합니다. 생산 모니터링은 또한 비평가 신호를 포함합니다. 지연성, 오류율, 토큰 사용 및 추적 완성도는 서비스 행동을 설명합니다. 응답 품질 평가자는 샘플링 된 내용이나 행동을 설명합니다. 어느 쪽도 내일의 일정이 가능한 직원을 찾아낼 수 있다는 것을 확인하지 않습니다. 하나의 플랫폼에서 함께 표시될 경우에도 이러한 주장들을 분리하여 유지하십시오. 결승 경계는 인증을 필요로 합니다. 다른 판사가 아닙니다. 기사의 고정된 세 가지 사건은 같은 함정을 낳았습니다. 일반적인 LLM 점수가 통과되었지만 유일한 방어 가능한 판결은 UNKNOWN 였습니다. 1. 이 랭타임 건강 사건은 예상되는 일과 성과를 기록했지만, 새로운 심장 박동은 없었습니다. 오래된 좋은 작업은 현재의 접근성이 입증되지 않았습니다. 2. 도구 효과 케이스는 안정적인 운영 ID를 가지고 있었지만 목적지에서 인증을 받지 못했습니다. 타임아웃은 아무런 효과도 없거나 완전한 효과를 숨길 수 있습니다. 3. 최종 납품 가능한 케이스에는 수용 테스트 정의가 있었지만, 유물 검사 금액은 없었습니다. 검증할 만한 구체적인 것은 없었습니다. LLM 판사는 이러한 격차를 해결할 수 없습니다. 모델에게 근로자가 살아있는지 물어보는 것은 심장 박동을 일으키지 않습니다. 아마도 이메일이 전송되었는지 묻는 것은 제공자의 영수증을 생성하지 않습니다. 파일이 완성된 것처럼 들리는지 묻는 것은 파일이 필요한 경로에서 존재한다는 것을 증명하지는 않습니다. 경계 근처의 결정적 증거를 선호합니다. 신선한 심장 박동과 가용성에 대한 예상 실행 기록; 실행에 필요한 비비밀 실행 ID에 연결된 진행 영수증; 외부 효과에 대해 읽은 목적지 키와 무력성 키; 시퀀스, 스키마 검증, 테스트 결과 또는 배달 상품의 목적지 문의 돌이킬 수 없는 소송에 대한 승인된 결정 영수증. 실종된 증거는 여전히 실종되어야 합니다. UNKNOWN 는 운영적으로 유용하게 작동하는 상태입니다. 왜냐하면 그것은 성공이나 실패를 발명하지 않고도 연구를 진행하기 때문입니다. 8건의 증거 로우팅 감사를 재현 이 문서에 사용된 검사 가능한 유물은 8개의 결정 사례를 포함하고 있습니다. 각 사건은 결정과 증거와 예상된 경로와 예상된 판결을 선언합니다. 핵심 정책은 의도적으로 기계적입니다. 이 조치는 후보자 품질, 방출 회귀, 라이브 품질 유동, 런타임 건강, 외부 효과, 최종 결과물, 주관적 검토 및 인적 권위를 포함합니다. 실행하여 생성: 모든 8건 모두 예상된 증거로 도달했습니다. 5명은 제한된 주장을 입증할 충분한 증거를 가지고 있었습니다. 세 가지는 알려지지 않았으며, 세 가지 모두 정책이 일반적인 합격 점수를 받아들인다면 녹색으로 보일 것입니다. 이것은 보편적인 표준이 아닙니다. 실제 작업 흐름에서 결정된 결정으로 고정된 장치를 교체하십시오. 실행시간과 목적지가 제시할 수 있는 정확한 증거 이름을 추가하세요. 실패 동작을 유지하십시오: 필요한 신호가 없는 경우 알려지지 않은 것을 반환하고 실종된 필드를 나열하십시오. 실재를 0점으로 변환하지 마십시오. 왜냐하면 0은 측정이 일어난다는 것을 암시하기 때문입니다. 검증 대상 이후만 득점자를 선택하세요 목표가 맞으면 득점자 선택이 더 쉬워집니다. 특성이 결정적인 경우 코드를 사용: JSON 모양, 도구 이름, 논쟁 범위, 체크섬, 파일 존재, 테스트 상태 또는 목적 상태. 부동산이 진정으로 양질의 경우 LLM 판사를 사용하며 명확한 라브릭, 캘리브레이션 세트 및 의견 충돌 검토 경로를 가지고 있습니다. OpenAI의 가이드라인은 오픈 엔딩 판단을 만드는 것보다 모형이 옵션을 차별화하는 데 종종 더 신뢰할 수 있다고 지적하므로 쌍방향 비교 또는 분류는 제한되지 않은 점수보다 강해질 수 있습니다. 안정적인 주류, 법적 또는 정책적 권위, 큰 영향력 있는 모호함, 비밀 또는 돌이킬 수 없는 행동 없이 결정에 대한 인간의 검토를 사용하십시오. 재판관은 심사위원에게 증거를 요약할 수 있습니다. MLflow의 평가 문서는 데이터 집합, 점수자, 예측 기능, 인간 피드백, 체계적인 평가 및 생산 모니터링을 관련 기능으로 설명합니다. 그것은 유용한 실행 메뉴입니다. 라우팅 규칙은 여전히 애플리케이션 소유자에게 속한다. 도구는 점수를 계산할 수 있지만, 점수가 어떤 결정을 지지할 수 있는지 정의할 수 있는 것은 소유자일 뿐이다. 4개의 판결을 석방과 운영 기록에 보관하라 컴팩트 된 평가 기록은 네 가지 질문에 독립적으로 대답해야 합니다. 지원자는 오프라인 품질 기준을 충족시켰습니까? 기본 기준에 비해 금지된 회귀를 피했나요? 신선한 생산 샘플은 온라인 기준에 부합합니까? 기대되는 작업은 건강하고 약속된 결과는 검증되나요? 그 답변을 평균적으로 생각하지 마세요. 공개는 아직 생중계된 증거가 없는 상태에서 오프라인 평가를 통과시킬 수 있습니다. 생산 샘플은 계획된 실행을 놓친 상태에서 건강하게 보일 수 있습니다. 마지막 유물이 없는 동안 흔적이 완성된 것처럼 보일 수 있습니다. 각 판결, 증거의 시간, 그리고 그 범위를 보존하십시오. 이것은 더 조용한 운영 규칙을 생성합니다. 데이터 세트 및 샘플 실행으로 모델 및 응용 동작을 평가합니다. 접근성, 일정, 대기 및 진행 증거로 실행 시기의 건강을 평가합니다. 목적지에 외부 결과를 확인합니다. 실종되거나 실패한 경로를만 격화시켜라. Sidewisp는 현재 비공개 프리뷰 단계입니다. 기존의 에이전트 런타임에 대한 건강 계층으로 설계되고 있지만 생산 모니터링 어댑터와 복구 시스템은 일반적으로 배송되지 않습니다. 잘 보이는 실행과 검증된 결과 사이의 구별이 당신이 해결하려고 하는 문제라면, 개인 미리보기 대기 목록은 적절한 다음 단계입니다.