2026-08-01T01:58:01.255Z

Datadog LLM 관찰성 실험: 프로모션 게이트를 추가

비교에 대한 지문, 라인 커버링을 증명하고 유효한 대기 시간을 유지하며, 프로모션 전에 미흡하거나 복제 효과를 차단합니다.

Datadog LLM 관찰성 실험은 후보 프롬프트, 모델, 공급자 또는 에이전트 아키텍처가 더 좋은 점수를 받았으며 더 빨리 실행되었음을 알려줍니다. 그건 유용한 증거이지만 아직 석방 결정은 아닙니다. 합리적인 기본은 동일한 Datadog 프로젝트 내에서 후보와 기본 라인을 비교하고 데이터 세트 버전을 픽업하고 평가자 정의를 안정적으로 유지하며 분포와 흔적을 검사하는 것이 아니라 평균을 신뢰합니다. 그 다음 점수 카드 바깥에 작은 프로모션 게이트를 추가하십시오: 모든 요구된 기록이 실행되었음을 증명하고, 예상된 대기들은 기다림으로 남아있었고, 돌연변이 사례는 정확히 같은 효과를 얻었고, 완료된 사례는 목적지 인증을 가지고 있음을 증명합니다. 이 기사에서는 8개의 기록으로 그 마지막 단계를 실행합니다. 지원자는 평가자의 합격률을 75%에서 100% 로, 평균 기간은 980 ms에서 738.75 ms 로 옮긴다. 승진은 여전히 차단되어 있습니다. 한 환불은 확인된 목적지 영수증을 가지고 있지 않으며, 한 취소는 두 가지 효과를 가져왔다. 먼저 두 실험이 비교가능하다는 것을 증명해 보세요. Datadog의 실험 개요는 세 가지 핵심 작업을 설명합니다: 버전 데이터 세트, 실험을 실행하고 결과를 비교합니다. 현재 설치 문서는 레코드 평가자와 선택적 요약 평가자를 사용하여 데이터 세트 기록을 통해 순차적으로 실행되는 작업으로 실험을 정의합니다. 작업 내부는 생산 코드와 동일한 추적 장식 장치를 사용할 수 있습니다. 그 원시들은 비교할 수 있는 좋은 자료를 제공합니다. 그들은 두 경주 사이에 동일하게 유지되어야 하는 것을 정의해야 할 필요성을 제거하지 않습니다. 점수를 보기 전에, 내용 없는 매니페스트를 기록하세요: 해시들은 평가자 코드를 식별합니다. 그들은 명령어, 출력, 자격증 또는 고객 데이터의 해시가 아닙니다. 이 매니페스트의 카노닉 JSON 시리얼링을 해시하고 두 실험 기록에 지문자를 첨부합니다. 이 장치는: 만약 손가락 표지가 다르다면, 그 결과를 쌍용 비교라고 부르지 마십시오. 변경된 데이터 세트 버전은 하드 케이스를 추가할 수 있습니다. 변경된 평가자는 문턱을 옮길 수 있습니다. 부족한 기록은 중요한 실패를 제거함으로써 평균을 향상시킬 수 있습니다. 이러한 변화는 합법적이지만 새로운 기준이 필요합니다. Datadog의 제품 통행는 데이터 세트가 버전 제어 기능을 지원하고 특정 버전에 고정될 수 있다고 말합니다. 또한 비교 표면은 평균, 분포, 지연, 비용, 토큰 카운트, 출력 및 기간 흔적을 노출한다고 설명합니다. 이 모든 것을 사용하세요. 매니페스트는 다타도그의 증거를 대체하지 않습니다. 당신은 그것을 해석하기 전에 우연한 비교 유동을 방지합니다. 평균에 동의하지 않는 게이트를 실행하세요 이 문서의 검사 가능한 유물은 표준 라이브러리 파이썬 스크립트입니다. 그것은 8개의 합성 음반을 포함하고, 내용 없이 JSON를 방출한다. 다음으로 실행하세요: 핵심 규칙은 의도적으로 작습니다. 이것은 두 번째 모델에 첫 번째 모델이 성공한 것 같지는 않은지 묻지 않습니다. 그것은 당신이 통제하는 의미의 명시적인 필드를 확인합니다. 전체 고정 수치는: 측정 기본 기준 지원자 : : 현존하는 기록 8/8 8/8 평가자 합격률 75% 100% 평균 기간 980 ms 738.75 ms 차단 기록 — 2 승진 결정 — Block 데이터도그 평가 개발자 가이드는 입력된 평가자 결과, 선택적 합격/실패 평가, 메타데이터, 태그 및 요약 평가자를 지원합니다. 이는 평가자를 evaluatorPass 에 적합한 소스로 만듭니다. 그것은 모든 평가자를 목적지 검증자로 만들지는 않습니다. 평가자가 생성된 텍스트를 예상된 답변과 비교하면 환불이 사전에 도달하지 않는 동안 통과될 수 있습니다. 이 증거 라인을 분리시켜라. E평가 라인: 출력은 선택된 품질 규칙을 충족시켰습니까? Trace lane: 어떤 LLM, 검색, 도구 및 작업 단계가 실행되었으며 어떤 오류 또는 지연이 있었습니까? 국립 라인: 사건은 작동하고, 합법적으로 기다리고, 완전하고, 불확실하거나, 사람이 필요했습니까? E 효과 라인: 의도된 외부 돌연변이가 정확히 한 번 발생했습니까? O 출력 라인: 목적지에는 이제 약속된 결과가 있습니까? 첫 번째 두 바퀴는 데이터도그 실험의 자연 입력입니다. 나머지 라인들은 작업 계약, 장치, 목적지 시스템에서 나온다. 여러분은 그들의 결과를 사용자 정의 평가나 실험 메타데이터로 제출할 수 있습니다. 그러나 진실을 가진 한계에 정의할 수 있습니다. 두 개의 차단된 기록은 서로 다른 실패를 나타냅니다. issue refund 기록에는 통과 평가자, complete 상태, 그리고 하나의 시도 효과가 있습니다. 그 outcomeReceipt 는 missing 입니다. 이것은 환불이 실패한 증거가 아니라 완료가 확인되지 않은 증거입니다. 안전 판결은 Uncertain , 녹색이 아니라 자동으로 다시 시도하지 않습니다. cancel subscription 기록에는 통과 평가자와 검증된 목적지 영수증이 있지만, effectCount 는 두 개입니다. 성공적인 최종 상태는 복제 효과를 지우지 않습니다. 후보자는 개량 점수를 향상시키면서도 안전에 영향을 미치기 때문에 차단됩니다. approval required 기록은 반대 경계를 보여줍니다. 예상 상태는 waiting 이며, 후보자는 소유자, 임기 및 재개 토큰을 제공합니다. 지나가죠. 알려진 의존성을 가진 일시 중지은 정지하지 않습니다. 따라서 complete 에 끝나는 모든 줄이 필요한 게이트는 올바른 행동을 처벌합니다. 이 사건들은 의도적으로 불편합니다. 프로모션 게이트가 평가자 점수를 반복하는 경우에, 그것은 방출 결정을 변경할 수 없습니다. 유용한 게이트는 이렇게 말할 수 있어야 합니다. 비교가 비효율적 인 이유는 기록의 커버리가 변경되었기 때문입니다. 지원자는 품질에 있어서 더 좋지만 효과에 대해서는 안전하지 않습니다. 지원자는 더 빨리 진행하지만 결과는 알려지지 않았습니다. 기다림은 유효하며 실패로 간주되어서는 안 됩니다. 증거는 충돌하기 때문에 사람이 결정해야 합니다. 실제 데이터도그 실험에 게이트를 연결해 데이터도그의 현재 설정 가이드는 문서화된 파이썬 실험 경로를 위해 ddtrace =4.3.0 를 요구하며 API 키와 응용 키 모두 필요합니다. 그 비밀을 환경 변수에 보관하세요. 매뉴스, 데이터 세트 라인, 기사 유물, 또는 추적 속성에는 넣지 마십시오. 기존 실험 작업 흐름에 대해, 5개의 제한된 단계로 게이트를 추가하십시오. 1. 비교 계약을 얼어붙이십시오. 각 레코드에 대한 Datadog 프로젝트, 데이터셋 아이덴티티 및 버전, 주문된 레코드 ID, 평가자 코드 해시, 작업 개정, 후보 구성 및 예상 상태를 기록하십시오. 콘텐츠가 민감할 때 비명성 ID 또는 해시만 저장합니다. 2. 비율을 계산하기 전에 커버리지를 조정하십시오. 예상된 기록 ID를 관찰된 실험 기록과 비교하십시오. 실종, 복제 또는 예상치 못한 신분증은 비교할 수 없습니다. 명칭을 다시 돌아온 줄으로 조용히 줄이지 마십시오. 3. 작업 경계에서 결정적인 필드를 발급하십시오. 읽기 전용 작업에 대해서는, 수신기는 예상된 소스 개정과 연결된 스케마 유효한 응답이 될 수 있습니다. 돌연변이 작업을 위해, idempotency 키, 효과 아이덴티티, 그리고 목적지 측 검색을 사용하십시오. 다시 시도하지 말고, 저지른 결과를 계산해 보세요. 4. 터미널이 아닌 상태를 보존합니다. 대기 케이스는 이유, 소유자, 임대 및 신원을 재개해야 합니다. 자격증 사건은 needs human 로 끝낼 수 있습니다. 오프라인 점수를 더 쉽게 만들기 위해 답을 만들어내지 마십시오. 5. 승진할 경우만 승진할 수 있습니다. 후보자는 행보가 일치하면 승진할 수 있습니다. 커버리가 완료되면, 필요한 평가자가 통과하면, 운영 예산이 유지되면, 모든 주가 계약에 일치하면, 완료된 모든 결과가 검증되며, 모든 돌연변이 사례는 정확히 의도된 효과를 가지고 있습니다. 중형 평균은 대체가 되지 않습니다. 왜냐하면 높은 점수가 하나의 재앙적인 효과를 수학적으로 보상할 수 있기 때문입니다. 실용적인 정책 중 하나는 자문품질 매트릭, 지연기 및 비용에 대한 임계값을 조정합니다. 실종된 영수권, 복제 효과, 비밀 노출 및 무효 비교를 어려운 실패로 간주하십시오. 귀하의 도메인이 더 안전한 명시적인 규칙을 제공하지 않는 한. 이 감사가 증명하지 않는 것을 알고 이 장치는 8개의 사례와 규칙의 실행을 증명합니다. 데이터 세트가 생산 트래픽을 나타내고, 예상 출력이 올바르고, 평가자 해시가 검토된 코드와 일치하거나 목적지 영수증을 위조할 수 없다는 것을 증명하지 않습니다. 또한 데이터도그의 제품 품질을 측정하거나 모델을 비교하지 않습니다. 이러한 질문들은 데이터 집합 검토, 출처 통제, 접근 통제, 생산 샘플링 및 실제 목적지와의 조화를 필요로 한다. 데이터도그 실험은 실험 실행, 분포, 추적 및 평가자 결과를 연구하는 장소로 남아 있습니다. 프로모션 게이트는 더 좁은 운영 결정을 추가합니다. 이 구체적인 비교는 변경을 승인하기에 충분히 완전하고 안전합니까? Sidewisp의 제품 방향은 기존 실행 시간 동안 에이전트 건강 증거, 불확실성 및 검증을 더 쉽게 해석하는 것입니다. 그것은 Datadog, 실행 시간, 또는 방출 과정을 대체하지 않습니다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 공공 사이트와 인터랙티브 시연은 실시간으로 진행되며, 생산 에이전트 건강 수집 및 Datadog 통합은 일반적으로 배송되지 않습니다.