2026-08-01T21:34:32.876Z

LLM 후속 폭풍에 대한 관찰 가능성: 확인된 결과당 비용은

복제 가능한 실행 레벨 감사로 둥지를 틀어 놓은 재실험 지출, 잘못된 성공 회계 및 목적지 검증된 에이전트 결과의 실제 비용은 노출됩니다.

LLM 관측 가능성은 토큰, 지연, 오류 및 모델 호출을 계산해야합니다. 다시 시도할 수 있는 에이전트에게는 숫자가 전부죠. 운용 용어는 목적지에서 검증된 의도된 결과의 수입니다. 따라서 유용한 비용 신호는 다음과 같습니다. 재실험 비용, 재실험 소유자 및 결과 상태를 안정적인 run id 아래 유지하십시오. 성공적인 API 응답이나 에이전트의 자신의 완전 메시지로 지출을 나누지 마십시오. 두 층 모두 작업 흐름이 반복되는 동안 건강하게 보일 수도 있고, 결과물이 없어지거나, 두 층이 조용히 같은 실패를 다시 시도할 수도 있습니다. 이 가이드는 고정된 8회 실험에 해당하는 규칙을 적용합니다. 안정적인 집단은 검증된 결과당 0.012달러를 지불합니다. 리트라이 스톰 코호르트는 선언된 완공당 0.041달러가 소요되는 것으로 보이지만 목적지 검사는 하나의 결과만을 증명하기 때문에 실제 숫자는 안정적인 코호르트의 0.123~10.3배입니다. 달러의 금액은 합성입니다. 회계 오류는 실제적이고 재현가능합니다. 정상적인 LLM 관찰성 계층을 유지하십시오. 합리적인 기본값은 여전히 모델 호출 텔레메트리입니다. 요청 기간, 입력 및 출력 토큰, 오류 클래스, 공급자, 모델, 동작 및 추적 상관관계를 기록합니다. 그 신호는 공급자가 느려졌는지, 컨텍스트가 확장되었는지, 모델이 변경되었는지 또는 통화 실패했는지 알려줍니다. 현재 OpenTelemetry GenAI 메트릭 컨벤션는 그 기본 콘크리트를 만듭니다. 2026년 7월 24일 결정된 위원회에서는 gen ai.client.token.usage 와 gen ai.client.operation.duration 를 정의합니다. 그들은 또한 에이전트 수준의 추론 호출과 도구 호출 수를 정의합니다. 이 문서는 Development 의 컨벤션들을 표시하고 있으므로 구현된 버전을 꽂아서 필드가 이동할 것으로 예상합니다. 토큰 사용은 자동으로 비용이 발생하지 않습니다. 제공자는 청구 가능한 토큰 수를 반환할 수 있고, 게이트웨이에서는 추정치를 계산할 수 있으며, 청구서는 나중에 금액을 조정할 수 있습니다. 값과 함께 출처를 유지하십시오: 불투명한 실행 식별자를 사용하세요. 명령어, 응답, 자격증, 도구 논쟁, 고객 콘텐츠 및 절대 경로는 비용 차원에 속하지 않습니다. 보호된 흔적은 허가된 조사에 사용할 수 있을 수 있습니다. 집합은 시도를 찾아내기 위해 충분한 정보를 필요로 합니다. 그리고 그 회계를 설명합니다. 통화를 통한 그래프는 여전히 가치가 있습니다. 그들은 단순히 다른 질문에 대답합니다. 모델 응답에 따른 비용의 감소는 작업 흐름에 따른 시도의 증가와 공존할 수 있습니다. 성공한 재시험은 일시적인 제공자의 오류를 수정할 수 있으며 동일한 작업이 줄을 서서 그 후 에이전트가 재시험한 것을 숨길 수 있습니다. 모델 텔레메트리는 전화를 설명합니다. 회계수사는 약속을 설명합니다. 검증된 결과를 명칭으로 설정 처형 전에 결과를 정의하십시오. 모델 반환된 텍스트는 호출 결과입니다. pull 요청은 예상된 약속이 있습니다. 보고서는 합의된 키 아래 존재합니다. 최소한의 경주 기록은 4개의 상태가 필요합니다. 국가 의미 비용 처리 건강 치료 verified 목적지 고유의 표기판이 통과되었습니다. 비용을 포함하고 명칭을 증가시키십시오. 완전함 missing 에이전트가 완료했다고 선언했지만, 선명기는 실패했습니다. 비용을 포함하고 명칭을 증가시키지 마십시오 거짓 성공 waiting 이름 붙여진 의존성이나 인간의 결정은 탁월하다 비용 을 포함 하십시오. 아직 성공 이나 실패 이라고 말 해 주십시오. 의존자 소유자에게 가는 길 unavailable 검증자는 실행되지 않았거나 증거가 쓸모가 없습니다 알려진 비용을 포함하고, 유효한 명칭이 없는 경우 비율을 알 수 없습니다. 증거 보급을 조사 이러한 구별은 편리하지만 파괴적인 단축 경로를 방지합니다. 만약 사람이 변화를 승인하지 않았다면, 에이전트가 기다리고 있습니다. 반복적으로 모델을 실행하는 것은 권위를 창출하지 않습니다. 검증기가 오프라인에서 작동하지 않는 경우, 그 부재를 실패로 간주하면 복제 부작용이 발생할 수 있습니다. 만약 대리인이 " Done"라고 말하지만 목적지가 빈 상태라면, 선언을 성공으로 간주하면 잘못된 완료가 보상됩니다. 결과 기록을 시도에 참여하기 보다는 관찰 가능한 저장소에 배달된 것을 복사하는 것: 검증자는 가능한 한 결정적일 필요가 있다. 파일 해시, 데이터베이스 라인, API 필드, 테스트 결과 또는 목적지 상태를 확인하십시오. 질적 평가자는 결과를 선사적으로 표현할 수 없는 경우에 증거를 제공할 수 있지만 그 버전, 캘리브레이션 및 불확실성은 점수와 함께 포함됩니다. 재실험 비용 격차를 재현 이 실험은 8개의 합성 경주를 이용합니다. 4개의 연속 경주와 4개의 재시험 경주입니다. 각 실행은 시도 레벨 토큰과 비용 필드를 포함하고 있으며 최종 결과 상태가 있습니다. 폭풍은 한 가지 검증된 결과, 두 가지 잘못된 성공 선언, 그리고 한 가지 합법적인 승인을 기다리고 있습니다. 실행당 한 개의 NDJSON 객체를 저장합니다. 이 줄여진 쌍은 다음과 같은 모양을 나타냅니다. 각 시도를 그 코호르트 아래로 합쳐서 계산한다: 이 출판물에서 보존된 전체적인 장치와 감사는 다음과 같은 결과를 가져옵니다. 세 가지 관측은 운영 결정에 변화를 가져온다. 첫째, 폭풍의 완공에 대한 비용은 확인된 결과에 대한 비용을 3x로 낮춘다. 에이전트의 선언은 부적절한 결제 지표입니다. 둘째, 시도 증폭은 1.25에서 3.00로 증가합니다. 모델 호출 래시보드는 12개의 개별적인 정상적인 호출을 표시할 수 있지만 단지 4개의 약속에 속한다는 것을 보여주지 않습니다. 셋째, 폭풍의 지출의 62.6%는 초기 시도 이후 발생하고, 두 개의 다른 층이 그 재 시도를 소유하고 있습니다. 문제는 단순히 비싼 모델만이 아닙니다. 그것은 무한한 통제 경로입니다. 이 실험은 생산 실패율을 추정하지 않습니다. 그 가격과 케이스들은 회계 규칙을 시험하기 위해 구성되어 있습니다. 동일한 계산을 자신의 청구 또는 공급자에서 파생되는 비용으로 수행하고, 원천과 가격 버전을 유지하고, 시간이 지남에 따라 비슷한 작업 흐름을 비교하십시오. 다시 시도할 수 있는 예산의 한 층을 반복은 종종 옳습니다. 제한된 요청이나 일시적인 네트워크 오류가 지연 후 성공할 수 있습니다. 실패는 모든 계층이 독립적으로 회복을 소유한다고 결정할 때 시작됩니다. OpenAI 비율 제한 가이드라인는 무작위 기하급수적 백오프를 권장하고 실패한 요청은 여전히 분당 한계에 기여한다고 경고합니다. 따라서 지속적인 재배송은 복구에 필요한 용량을 소비한다. 현재의 AWS SDK 재시험 참조는 더 넓은 API 설정에서 동일한 제어 원칙을 문서화합니다. 제한된 최대 시도, jitter와 기하급수적 백오프, 그리고 예산이 채용되면 다시 시도하는 토큰 버킷. 이 자료들은 하나의 보편적 대리자 정책을 규정하지 않는다. 그들은 더 안전한 계약을 지원합니다. 1. 반복 시도의 소유자 하나를 선택하여 작전을 수행합니다. 일반적으로 가장 낮은 계층으로 임시 오류를 분류하고 무력성을 유지할 수 있습니다. 2. 첫 번째 요청과 모든 재시험을 1번의 실행 단계 시도와 비용 예산에 대비하여 계산하십시오. 3. 메타데이터를 상승으로 퍼뜨리기 위해 노력하여 작업 흐름 실행자는 SDK의 마지막 오류를 첫 번째 실패로 오해하지 않습니다. 4. 복귀할 수 없는 상태는 명시적으로 설정해야 합니다. 거부된 권한, 무효 입력, 실종 권한, 실패한 결과 검증은 라우팅 또는 조사가 필요합니다. 맹목적인 반복이 아닙니다. 5. 시간이나 노력이나 비용 예산이 다 지나면 멈춰라. 마지막 증거로 보이는 상태를 되돌려 주세요. 6. 다시 시도한 후 목적지를 확인하세요. 성공적으로 돌아온 명령은 약속된 결과가 아닙니다. 타임아웃은 특별한 주의가 필요합니다. 클라이언트 타임아웃은 원격 측이 아무것도 하지 않았다는 것을 증명하지 않습니다. 부작용 도구를 다시 시도하기 전에, idempotency 키를 사용하거나 목적지를 문의하십시오. 그렇지 않으면, 관찰성 시스템은 두 번째 시도를 올바르게 보고할 수 있으며 비즈니스 시스템은 두 개의 청구서, 메시지 또는 출판물을 수신할 수 있습니다. 회귀에 대한 경고, 그리고 결과를 검사 한 번 더 시도하지 마세요. 작업 흐름에 대한 기준으로 시작하여 끈기를 요구합니다. 유용한 첫 번째 경고는 다음과 같은 세 가지 조건을 결합시킬 수 있습니다. 그 값들을 작업 흐름에 맞추세요. 저렴하고 무능한 팬아웃을 가진 배트 프로세스는 더 많은 시도를 용납할 수 있습니다. 지불, 출판, 또는 고객 메시지 작업 흐름은 더 적은 것을 허용할 수 있습니다. 개별 공급업체는 도구 실패와 목적지 결실을 발생시키지 못하기 때문에 억제합니다. 그들은 다른 소유자와 다른 안전 행동을 가지고 있습니다. 알림은 영향을 받는 약속, 전체 시도, 재시험 소유자, 비용의 기원, 검증자 결과 및 신선함, 그리고 다음 제한된 조치의 이름을 지정해야 합니다. 유용한 메시지는 다음과 같습니다: 보고서 출판은 SDK 및 작업 흐름 실행자에서 12 번의 시도를 사용했습니다. 재실험 지출은 63%입니다. 네 가지 결과 중 하나는 검증됩니다. 재실험 소유권 및 사이트 지도 검증기를 검사하십시오. 그것은 단지 토큰 비용이 높다고 말하지 않아야합니다. 두 가지 중요한 한계가 있습니다. 비용 데이터는 지연되거나 추정되거나 불완전할 수 있으므로 커버링을 보여주며 0을 만들지 마십시오. 결과 검사는 또한 독립적으로 실패할 수 있으므로 unavailable 는 missing 와 구별되어야 합니다. 합법적인 waiting 런은 의존성이나 임기 변경이 될 때까지 검증된 지명자에서 밀착된 것으로 표시되지 않고 유지됩니다. Sidewisp의 제품 방향은 사용 가능성, 실행, 메모리, 도구 및 결과와 함께 비용과 같은 건강 신호를 포함한다. 기존 실행시간과 함께 작동하는 것이 아니라 의무적인 모델 게이트웨이나 자율 고정 장치가 되는 것이 목적이다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 공개 사이트 및 문서 라이브러리는 실시간으로; 생산 모니터링 어댑터, 토큰 비용 분석 및 복구 실행은 일반적으로 배송되지 않습니다. 개인 미리보기에 참여하고, 사람들이 권위를 유지하는 동안 증거, 비용 및 검증된 결과를 다시 시도하는 방법을 형성하는 데 도움이 되고 싶다면.