2026-08-01T09:31:04.629Z

MLflow LLM 평가: 런타임-헬스 풀레이스 게이트를 추가

MLflow의 평가 경로를 재현하고, 4개의 런타임 리시트를 추가하여 통과하는 점수가 거짓 녹색 에이전트 판례가 되지 않도록 한다.

MLflow LLM 평가는 당신이 선택한 기준에 해당하는 응용 프로그램의 출력 여부를 알려줄 수 있습니다. 그 자체로 에이전트가 도달할 수 있었다는 것을 증명할 수 없으며, 시간 내에 시작되었거나, 외부 부작용을 완료했거나, 약속된 배달 상품을 목적지에 남겼다는 것을 증명할 수 없습니다. 실질적인 기본은 MLflow 평가 결과와 런타임 건강 판결을 두 개의 증거 계층으로 보관하고, 두 가지 모두 공개되기 전에 요구하는 것입니다. MLflow 3.14.0로 그 경계를 테스트했습니다. 코드 기반의 점수는 3명의 에이전트가 exact deliverable/mean 의 완벽한 1.0 를 쳤다. 다른 4개의 영수권 건강 규칙은 그 중 한 번의 경기가 지나갈 수 있게 했습니다. 그 차이점은 MLflow의 결함이 아니었습니다. 득점자가 대답한 질문과 더 넓은 운영 결정의 일치가 없었다. 문서화된 MLflow 평가 경로를 재현 MLflow의 현재 평가 가이드는 데이터 세트, 하나 이상의 점수자 및 선택적 예측 함수로부터 평가를 정의합니다. 데이터 세트는 입력과 기대를 제공합니다. 예측 함수는 이미 존재하지 않는 경우 출력을 생성합니다. 스코어들은 사용 가능한 증거들을 피드백이나 매트릭으로 변환합니다. 이 분단은 평가문제를 명확하게 하기 때문에 유용하다. 만약 질문은 이 출력이 예상되는 배달 가능한 이름과 같았는가?, 결정적인 코드 기반 점수는 LLM 판사보다 더 적합합니다. MLflows 사용자 지정 점수자 문서는 점수자가 inputs , outputs , expectations 또는 전체 추적을 읽을 수 있으며 원시적인 결과 또는 더 풍부한 Feedback 를 반환 할 수 있습니다. 실험은 인라인 리스트, 미리 생성된 출력, 그리고 이 점수를 사용했습니다. MLflow는 exact deliverable/mean = 1.0 를 기록했습니다. 이것이 정의된 증거에 대한 올바른 결과입니다. 모든 출력 문자열은 예상과 일치합니다. 그 결과는 재현 가능하고 저렴하며 설명하기 쉽다. 또한 세 가지 요원 모두 건강합니다. MLflows 평가 데이터셋 문서는 회귀 예방, 버전 비교 및 타겟화된 품질 테스트를 위한 선택된 사례로 데이터 집합을 설명합니다. 그것이 올바른 정신 모델입니다. 데이터 세트는 그 예제와 점수를 기록하는 데 코딩된 주장을 위한 테스트 스위트입니다. 그것은 자동적으로 중요한 모든 생산 실패의 인구조사가 아닙니다. 평가 결과와 함께 운영 영수증을 넣는다 같은 장비는 각각의 작업에 작은 실행 시간 인증을 첨부했습니다. 그것은 정확한 출력 점수자가 검사하지 않은 네 가지 사실을 기록했습니다. heartbeatFresh : 실행 시간은 최근에 도달할 수 있습니다. scheduleOnTime : 예상되는 경기가 허용된 시간 내에 시작됩니다. effectVerified : 외부 목적지는 의도된 부작용을 확인합니다. deliverableVerified : 약속된 유물이 존재하고 목적지 확인을 통과합니다. 그 결과 비교는 다음과 같습니다. 임무 정확히 전달할 수 있는 실행 시간 증거 석방 결정 run 101 합격 4개의 영수권 모두 방출 run 102 합격 심박이 고갈된 상태; 효과와 전달 가능성은 확인되지 않은 상태 접근할 수 없는 블록 run 103 합격 시간표는 허용된 창을 놓쳤다 늦은 시간까지 3개의 평가 라인이 모두 통과되었습니다. 한 번만 풀 수 있었습니다. 올바른 문자열은 작업자가 사라진 후 캐시 반응에서 살아남을 수 있습니다. 적절한 용량이 사업 기간이 지나면 도착할 수 있습니다. 도구 호출은 목적지가 변하지 않는 동안 믿을 수 있는 확인을 반환할 수 있습니다. 이들 사건들 중 어느 것도 출력 점수를 무효로 만들지 않고, 그들은 석방 결정이 추가적인 증거가 필요한 이유를 보여준다. 층을 안정적인 task id 또는 run id 로 결합시켜 두어야 하지만 하나의 모호한 점수로 붕괴하지 마십시오. 콤팩트 음반은 이렇게 보일 수 있습니다. 합병의 핵심은 중요합니다. 그렇지 않은 경우, 연구팀은 현재 건강 영수증을 다른 버전, 환경, 또는 재시험의 평가와 비교할 수 있습니다. 응용 프로그램 버전, 데이터 세트 버전, 점수 버전, 환경 및 관측 시간을 포함하면 그 차원은 판결을 바꿀 수 있습니다. MLflow는 평가 및 추적 증거를 보유할 수 있으며, 실행 시간 또는 목적지는 여전히 오직 그만이 알 수 있는 사실을 제공해야 합니다. 실종된 증거는 unknown 로 취급하고, pass 로 취급하지 않는다. 심장 박동이 빠진 것은 주체 실패보다는 수집기 실패를 의미할 수 있습니다. 실종된 목적지 영수증은 기록 실패, 검증자가 실패하거나 통합이 사실을 드러낼 수 없다는 것을 의미할 수 있습니다. 그 국가들은 조사에 요구하고 녹색 방출을 정당화하지는 않습니다. 한 점수를 혼합하는 대신 2 게이트 결정을 사용하십시오. 실제 방출 규칙은 의도적으로 지루합니다. 각 조항은 자신의 증거와 신선함과 실패의 이유를 유지해야 합니다. 이는 운영자에게 한정된 다음 동작을 제공합니다. 평가 실패는 프롬프트, 모델, 도구 정책, 데이터 세트 또는 점수자로 돌아갑니다. 노화된 심장 박동은 시속이나 수집자 진단으로 이어집니다. 스케줄러, 줄을, 또는 용량 제한으로 가는 미흡한 스케줄 라이트. 검증되지 않은 효과는 외부 목적지가 조정될 때까지 다시 시도를 차단합니다. 생산자 또는 목적지 확인자에게 전달할 수 있는 길을 놓친 경우 이러한 분리 또한 LLM 판사가 의도하지 않은 권위자가 될 수 없도록 방지합니다. 판사는 정확성이나 품질이 의미적 평가를 필요로 할 때 가치가 있습니다. MLflow는 내장된, 가이드라인 기반, 사용자 지정 및 코드 기반의 점수를 명시적으로 지원합니다. 그 도구들을 사용해서 정한 기준에 따라 파일 존재, 데이터베이스 상태, API 자원, 테스트 결과 또는 서명된 영수증에 대한 결정적 목적지 확인을 선호합니다. 실험을 읽지 마십시오. MLflow는 생산 모니터링이 부족합니다. MLflow 문서 평가, 추적, 모니터링, 데이터 세트, 피드백 및 여러 종류의 점수자. 더 좁은 결론은 거짓됩니다. 여기서 수행된 정확한 평가 실행은 네 가지 운영적 사실을 확인하지 못했습니다. 왜냐하면 그 데이터와 점수자는 그것들을 테스트하지 않았기 때문입니다. 관련 증거가 있을 때 건강 지향 점수를 추가하거나 증거가 실행 시간 및 외부 시스템에서 있을 때 MLflow와 함께 건강 분류자를 유지할 수 있습니다. 고의적으로 작은 장치입니다. LLM 판사를 기준으로 평가하거나 규모로 MLflow를 테스트하거나 공급자를 비교하거나 모니터링 커버리를 측정하지 않습니다. 그 값은 통제된 부합성입니다: 동일한 평가 패스 3 개, 다른 운영 상태 3 개, 그리고 방출 결정을 설명하는 검사 가능한 규칙. 팀 운영 에이전트에게는 이 경계가 유용합니다. 가장 강력한 적절한 점수를 통해 출력 품질을 평가하고, 그들의 소스에서 운영 사실을 확인하고, 성공을 선언하기 전에 증거를 결합합니다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 계획된 역할은 기존의 실행 시간과 함께 건강 계층이며 MLflow를 대체하거나 통과된 평가가 건강한 요인을 의미한다는 자동 주장이 아닙니다. 현재 대중의 경험은 초기 접근 사이트와 제품 시범입니다. 생산 모니터링 어댑터는 일반적으로 배송되지 않습니다.