2026-08-01T15:00:24.713Z
AI 에이전트 평가 매트릭스: 다섯 신호, 합성 점수는 없다
거짓 성공, 알려지지 않은 도구 효과, 또는 비용이 많이 드는 실패를 숨기지 않고 에이전트 발매를 비교하기 위해 다섯 가지 명시적 지명자와 단단한 증거 게이트를 사용하십시오.
AI 에이전트 평가 매트릭은 디시보드를 장식하는 것이 아니라 방출 질문에 대답해야 합니다. 도구를 사용하는 에이전트에 대해서는 컴팩트 기본값은 작업 품질, 유용한 진보, 도구 효과의 무결성, 검증된 결과에 대한 비용 및 잘못된 성공률을 구분하는 다섯 가지 측정입니다. 각각의 증거에 대한 기록이 있습니다. 그러면 미흡한 결과와 알려지지 않은 도구 효과를 평균을 최적화하기 전에 하드 게이트로 만들 수 있습니다. 순서가 중요해요 후보자는 더 나은 시술을 쓰고 더 빨리 마무리하고 검증되지 않은 결과물을 생산하면서 한 번 더 저렴하게 보일 수 있습니다. 그 신호를 평균적으로 한 점으로 나누는 것은 안전하지 않은 방출을 수치적으로 개선시키는 것입니다. 1점 대신 5개의 지칭을 유지하세요 에이전트 평가에는 하나 이상의 관심사가 있습니다. 에이전트 평가에 대한 인트로피스 엔지니어링 가이드는 작업, 반복된 시험, 등급, 기록 및 환경의 최종 상태를 구분합니다. 항공편 예약 예제는 유용한 경계입니다. 이 기록은 항공편을 예약했다고 말할 수 있지만 결과는 데이터베이스에 예약이 있는지 여부에 달려 있습니다. 현재 Vertex AI 에이전트 평가 설명는 또 다른 분리입니다. 최종 반응 평가에서는 에이전트가 목표를 달성했는지 여부를 묻습니다. 궤도 매트릭은 정확한 또는 질서있는 행동 일치, 정확성, 회수 및 단일 도구 사용 등 경로를 검사합니다. 두 견해 모두 유용하지만 둘 중 어느 것도 침묵으로 다른 것을 대신해서는 안 됩니다. 이 5개 계약을 사용하세요. 메트릭 계산기 표명자 별도로 보관합니다. 방출 역할 업무 품질 버전 된 라우브릭 또는 결정적인 품질 점수의 합 품질평가자가 실제로 실행한 시험 더 높은 버전, 커버링, 의견 불일치 확고한 증거가 지나면 최적화 유익 한 발전 작업별 증거 델타를 가진 활성 관찰 창 관찰된 활성 창 뚜렷한 대기 창과 오래된 수집기 바닥, 그리고 최적화 도구 효과의 무결성 목적지에서 확인된 외부 효과 검증된 + 실패한 + 알려지지 않은 효과 시도 의도적으로 거절된 통화, 알려지지 않은 효과 단단한 바닥 검증된 결과별 비용 전체 커버된 운용 비용 목적지 확인 결과 추정된 비용, 결제 보험이 없는 경우 예산 바닥 및 최적화 거짓 성공률 결과 검사가 실패한 선언된 완공 모든 선언된 완공 검증자가 사용할 수 없는 완료 가혹한 거부권 각 지명자는 다른 거짓말을 막습니다. 평가를 받지 않은 평균적인 품질은 가장 쉬운 예들을 보상합니다. 목적지 증거 없이 도구의 성공은 성공적인 호출과 성공적인 효과를 혼동합니다. 1회에 드는 비용은 값싼 실패를 보상합니다. 완공률은 에이전트가 자신의 청구권을 평가한 것에 대해 보상합니다. 운영 텔레메트리는 여전히 리저에 포함됩니다. 고정된 OpenTelemetry GenAI 매트릭스 스냅샷는 토큰 사용, 운영 기간, 에이전트 기간, 추론 호출 수, 도구 호출 수, 도구 기간을 위한 개발 상태 도구를 정의합니다. 이러한 측정은 작업량과 효율성을 설명합니다. 그들은 파일이 존재하고, 청구서가 한 번 만들어졌거나, 예정된 보고서는 목적지에 도달했다고 주장하지 않습니다. 임대값을 선택하기 전에 증거 기록을 작성하십시오. 시험마다 한 줄부터 시작하세요. 합계 차트 를 시작 하지 마십시오. 최소한의 기록은 모든 수자, 지명자, 배제 및 사용할 수 없는 상태를 재현하기에 충분한 정보가 필요합니다. 중요한 값은 0.90 가 아니라 그 주변의 불일치입니다. 응답 평가자는 출력을 좋아했지만 결과 검증기는 사용할 수 없었고 도구 효과는 알려지지 않았습니다. 이 실험은 반응의 질에 대해 가르쳐 줄 수 있습니다. 방출 주장을 뒷받침할 수 없습니다. 부재가 가능한 경우 세 가지 증거 상태를 사용하십시오. verified 는 이름 붙여진 표본이 의도된 목적지에 달아 지나간 것을 의미합니다. failed 는 predicate가 실행되고 예상 상태가 অনুপস্থিত 또는 허용되지 않는 것을 의미합니다. unavailable 는 검증자, 수집자, 허가자 또는 목적지 증거가 부족했기 때문에 판결이 불가능하다는 것을 의미합니다. unavailable 를 0으로 변환하거나 성공하지 마십시오. 0은 측정입니다. 가용하지 않은 것은 커버리지 결함입니다. 기다림은 비슷한 보살핌을 필요로 합니다. 명시적인 승인을 받은 소유자, 요청된 결정, 임대 및 재개 가능한 상태가 있는 경기가 붙지 않습니다. 기다림 전에 활성 창에서 유용한 진전을 계산하고, 그 다음 활성 진전 시계를 중지하십시오. 제한이 효과가 있다는 증거로 거부된 고효과 도구 호출을 유지하십시오. 의도적인 거부를 도구 실패로 간주하지 마십시오. 작업 품질은 여러 종류의 grader 유형이 필요할 가능성이 있는 한 가지 메트릭입니다. 구조화된 필드, 파일, 데이터베이스 라인, HTTP 상태 및 정확한 정책 조건에 대한 결정적 테스트를 사용합니다. 모델 등급자는 음색, 관련성, 또는 개방형 유물을 점수할 수 있지만, 그 프롬프트, 모델, 루브릭 버전 및 캘리브레이션 샘플을 저장할 수 있습니다. 인간의 검토는 여전히 판단이 결과적이거나 모델 평가자의 의견이 일치하지 않는 비율이 이해되지 않을 때 필요합니다. 방출 반전을 재현 이 문서에 보관된 유물은 10개의 합성 실험을 포함하고 있습니다. stable v1 에 대한 5개와 fast v2 에 대한 5개. Node.js 20 또는 최신 버전으로 실행하세요: 선언된 임계値は 다음과 같습니다. 정확한 요약은 다음과 같습니다. 변종 품질 유익 한 발전 도구 효과 확인 비용 / 운행 비용 / 검증된 결과 거짓 성공 확인되지 않은 완전 문 : : : : : : : stable v1 0.818 (4/4) 14/14 5/5 $0.41 $0.52 0/4 0 패스 fast v2 0.902 (5/5) 15/16 4/5 $0.38 $0.63 1/5 1 실패 세 가지 관측이 결정을 바꾸고 있습니다. 먼저, fast v2 는 분모가 실행되면 더 저렴하게 보입니다. 0.38달러 대신 0.41달러입니다. 일단 지출이 검증된 결과로 나뉘면 결론은 뒤집어진다: 0.63달러 대신 0.52달러. 더 빠른 버전은 모든 시도에 더 적은 비용과 신뢰할 수 있는 모든 결과에 더 많은 비용을 지출합니다. 둘째, 더 높은 0.902 품질 점수는 실종된 결과를 복구하지 않습니다. 한 은 완성품은 환경 검사를 하지 못했고 다른 하나는 사용 가능한 검증기가 없었습니다. 품질 및 유용한 진전 평균은 진단적이지만 외부 효과를 게시하거나 지불하거나 메시지, 삭제하거나 다른 방법으로 받아들이는 권한은 없습니다. 셋째, stable v1 에는 합법적인 승인 대기권이 포함되어 있습니다. 완료된 시험 품질 지명기에는 존재하지 않지만 기다리기 전에 이루어진 진전과 의도적으로 거부된 도구 호출은 여전히 눈에 띄게 남아 있습니다. 메트릭 계약은 완성 극장을 보상하거나 올바른 휴식을 처벌하지 않습니다. 이 실험은 반사유상이고 기준이 아닙니다. 가격, 시험 및 임계값은 회계 규칙을 시험하기 위해 구성됩니다. 그들은 생산의 잘못된 성공률을 추정하지 않으며 $0.60 는 보편적인 예산이 아닙니다. 품질을 최적화하기 전에 게이트 증거 매트릭을 고정 순서로 적용한다. 1. 체크 커버리지. 모든 선언된 완료는 결과 판결 또는 명시적으로 사용할 수 없는 상태가 필요합니다. 모든 효과적 도구 시도는 검증되거나 실패하거나 알려지지 않은 목적지 증거가 필요합니다. 2. Block 잘못된 성공. 선언된 완공이 결과 확인에 실패하면 방출을 중지하십시오. 응답 스타일이 아닌 완성 전언을 조사해 보세요. 3. Block 알려지지 않은 효과. 알려지지 않은 부작용은 사건의 한계입니다. 다시 시도하기 전에 목적지 검색 또는 무력함 키를 조정하십시오. 4. 진행 및 도구 바닥을 확인합니다. 비슷한 작업을 비교하고 유효한 대기 시간을 유지하십시오. 진전 회귀 또는 실패한 도구 효과 비율은 최종 품질이 상승했을 때에도 역전을 정당화 할 수 있습니다. 5. O 품질과 비용을 최적화하십시오. 이제 확인된 결과별로 라브리크 점수, 지연기, 토큰 및 비용을 비교합니다. 이것은 의도적으로 중량화 된 화합물이 아닙니다. 무게는 관계없는 손해 사이의 협상을 촉구합니다. 충분한 유창성은 수학적으로 한 개의 복제 지불을 취소 할 수 있습니다. 충분한 값싼 실행은 실종 보고서를 숨길 수 있습니다. 정책은 여전히 작업 품질 라부리 내에서 무게를 사용할 수 있지만 증거 커버링과 외부 효과는 그 점수를 벗어납니다. 작업 흐름의 결과와 기본 라인에서 임계값을 선택하십시오. 읽기 전용 연구 에이전트는 대부분의 호출이 되돌릴 수 있기 때문에 낮은 도구 효과 바닥을 용납할 수 있습니다. 출판, 결제, 고객 메시지 또는 액세스 제어 에이전트는 해당 테스트 스위트에 대한 목적지 인수, 무효 및 무사실 목표가 요구되어야 합니다. 실험 수치가 충분히 크면 신뢰 간격을 보고하고, 그렇지 않은 경우에는 원자 수치를 표시하십시오. 5개의 실험은 0/5 입니다. 인구 실패율은 0이 아니라는 증거는 아닙니다. 평가와 생산 건강은 서로 연결되어 있지만 구별되지 않습니다. 오프라인 시험은 후보자가 알려진 시나리오에서 살아남는지 여부를 알려줍니다. 생산 모니터링은 실제 스케줄, 자격증, 의존성, 비용 및 결과물이 출시 후 건강하게 유지되는지 알려줍니다. 패싱 스위트는 선언된 범위 내에서 배포할 수 있는 허가를 의미하며, 미래의 실행이 실패할 수 없다는 증거가 아닙니다. Sidewisp의 제품 방향은 결과, 진전, 도구, 가용성, 메모리 및 비용 증거를 기존의 에이전트 실행 시간 주위에 한 건강 관점으로 배치하는 것입니다. 대체 실행시간이나 필수 게이트웨이 또는 자율 고정 장치가 아닙니다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 공개 사이트 및 문서 라이브러리는 실시간으로; 생산 에이전트 건강 수집, 런타임 어댑터, 토큰 비용 분석 및 복구 실행은 일반적으로 배송되지 않습니다. 먼저 5개 메트릭 계약을 하나의 결과적인 작업 흐름에 사용하세요. 가장 잘 보이는 평균을 가진 버전이 여전히 결과 또는 도구 효과 게이트를 실패한다면, 매트릭은 그들의 일을 수행했습니다.