2026-08-01T08:39:08.975Z
에이전트 라이트닝: 에이전트에게 도착하기 전에 모든 RL 업데이트를 종료하십시오
에이전트 라이트닝의 배포, 랜즈, 보너스, 카나리 결과, 승인을, 그리고 배반을 모든 훈련된 리소스에 대한 증거가 뒷받침된 게이트로 전환하십시오.
논문 Agent Lightning: Training ANY AI Agents with Reinforcement Learning 은 중요한 엔지니어링 질문에 대답합니다. 기존의 에이전트가 RL 루프를 중심으로 재구성되지 않고 훈련 데이터를 생성하는 방법은 무엇입니까? 그것은 다음의 공개 질문에 대답하지 않습니다: 새로 훈련된 자원이 실제 작업 흐름에 영향을 미칠 수 있는 것은 언제인가? 안전한 기본은 모든 새로운 모델이나 리소스를 후보로 유지하는 것입니다. 정확한 부모, 데이터 스냅샷, 평가자, 배포 시도, 추적 커버리지, 보호된 사례, 제한된 카나리 결과, 승인 및 테스트 된 롤백에 대한 업데이트에 참여할 수있을 때만 홍보하십시오. 더 높은 보상을 받는 것은 유용한 증거이지만 건강 판결은 아닙니다. 그 경계는 그 틀에 부합하는 것이 아니라 그 틀에 부합하는 것입니다. 에이전트 라이트닝은 이미 에이전트 실행과 학습 알고리즘을 분리하고 있습니다. 방출 게이트로 분리된 곳을 보존해 라이트닝 에이전트가 기록하고 있는 것과 그 기록들이 증명하는 것은 종이는 에이전트 라이트닝을 RL 훈련에서 에이전트 처형을 분리하는 방법으로 제시합니다. 그것은 마코프 결정 프로세스로 에이전트 실행을 모델링하고, 신용 할당 모듈을 통해 에이전트 궤도를 교육 전환으로 변환하고, 텍스트에서 SQL, 검색 증강 생성 및 수학 도구 사용에 대한 실험을 보고합니다. 현재 프로젝트 문서는 운영자에게 더 구체적인 명칭을 제공합니다: Resource 는 알고리즘이 업데이트할 수 있는 자산, 예를 들어 모델 또는 프롬프트 템플릿입니다. Rollout 는 자원에 대한 작업 단위입니다. Attempt 는 재시작을 포함하여 해당 배포의 한 실행입니다. Span 는 실행의 사건이나 흔적을 기록합니다. Reward 는 출범 기간에 첨부된 숫자 판단입니다. LightningStore 는 에이전트를 실행하는 러너와 증거를 소비하고 리소스를 업데이트하는 알고리즘을 연결합니다. 이것은 강력한 훈련 인터페이스입니다. 완전히 풀린 영수증은 아닙니다. 결국 4번의 시도가 필요했던 성공적인 배포를 생각해 보십시오. 그 최종 보상은 잘 보일 수 있지만 재시험은 결정적이지 않고, 비용의 빚 또는 간헐적으로 실패하는 의존성을 드러낼 수 있습니다. 두 번째 롤라웃은 높은 보상을 받을 수 있지만 예상되는 기간의 31%가 사라질 수 있습니다. 세 번째는 파괴적인 도구 호출을 방지하는 하나의 보호된 케이스를 깨고 평균 평가 점수를 향상시킬 수 있습니다. 다른 실패들이죠. 기록 유익 한 질문 에 대한 해답 그 질문은 혼자 대답하지 않습니다. 발급 어떤 임무가 시도되었습니까? 의도된 외부 결과는 존재했나요? 시도 얼마나 많은 사형 집행이 일어났으며 어떻게 끝났다? 마지막 성공은 안정적이었나요? 아니면 그저 행운이었나요? 스펜 어떤 기구적 인 사건들이 관찰 되었습니까? 중요한 무기술적 효과는 맞습니까? 보상 어떤 판사가 어떤 행동을 어떻게 점수를 받았을까요? 보호적 인 행동, 개인 정보, 그리고 배반은 그대로 유지되었는가? 리소스 업데이트 어떤 모델이나 서식품이 사용 되었습니까? 그 자원이 기본으로 바뀌어야 할까요? 공식적인 아키텍처가 알고리즘이 스펜에서 학습하고 리소스를 업데이트 할 수 있도록 허용하기 때문에 차이점은 달리는 사람이 배포 권한이 되지 않고 중요합니다. 그게 특징입니다. 최종 자료를 승인된 자료로 취급함으로써 삭제하지 마십시오. 훈련 업데이트에 대해 한 인증을 붙여주세요. 3단계로 구성된 하나의 변함없는 업데이트 영수증을 사용하십시오. 영수증은 라이트닝 스토어 기록에 연결되는 안정적인 식별자를 저장하는 한 라이트닝 스토어 외부에 보관할 수 있습니다. 훈련 전: 정체성과 권위를 얼어붙이는 방법 지원자 리소스 ID, 정확한 모자 리소스 ID, 훈련 데이터 스냅샷, 보유된 데이터 스냅샷, 평가자 버전, 알고리즘 구성, 코드 개정 및 의도된 범위를 기록하십시오. 어떤 행위자가 카나리아를 승인할 수 있고 어떤 행위자가 자원을 기본으로 할 수 있는지 명시한다. 부모님은 여전히 로드 할 수 있는 유물을 선택해야 합니다. 최신 업데이트 는 계속적인 학습이 명령이 작성된 이후 세 가지 새로운 리소스를 생산한 경우 역전 목표가 아닙니다. 평가자, 보호된 사례, 승진 정책 및 역전기록을 학습자의 필기적 표면에서 제외하십시오. 그렇지 않으면 최적화자는 행동보다는 규칙을 변경함으로써 겉보기 스코어를 향상시킬 수 있습니다. 훈련 중에: 시도와 증거의 보급에 대한 설명 허용된 훈련 및 검증 창의 모든 롤 아웃에 대해, 다음을 유지하십시오: 정확한 기간 가족들은 작업 흐름에 달려 있습니다. 비변수는 이름보다 더 중요합니다. 결과를 보기 전에 어떤 증거가 존재해야 하는지 선언하고, 그 다음에는 실종된 증거가 존재하지 않는다고 보고합니다. 부재를 건강한 가치로 바꾸지 마십시오. 시도는 자신의 대가를 받아야 합니다. 한 번의 완료된 시도와 14개의 침묵적 실패로 이루어진 배포는 한 번 완료된 배포와 동등하지 않습니다. 훈련 전에 재시험 예산을 결정하고, 예상되는 재시험과 인프라 재시험을 구별하고, 모든 시도의 이유를 기억하십시오. 훈련 후: 운영 입학과 분리된 학습 성공 우선 후보자와 부모를 잠금 보관소에 비교해 보세요. 전체적인 결과를 보고하고 보호된 사례 가족들에 대한 제로 관용 또는 제한된 예산도 설정한다. 다음으로, 명시된 작업, 시간, 도구, 비용 및 부작용 경계를 초과할 수 없는 카나리에서 후보자를 실행하십시오. 카나리 영수증은 목적지를 확인해야 합니다. 만약 에이전트가 파일을 만들었을 때, 예상된 경로를 검색하고 그 내용을 확인하세요. 만약 티켓을 업데이트해야 한다면, 다시 읽어보세요. 만약 그 효과를 결정적으로 확인할 수 없다면, 약한 판사나 인간의 증거와 그 불확실성을 기록하십시오. 마지막으로, 테스트 롤백. 정확한 부모를 동일한 제한된 환경에 로드하고 라우팅이 다시 돌아갈 수 있음을 증명하십시오. 허가된 인간 또는 정책적 구속된 석방 행위자만이 다음 단계를 승인해야 합니다. 4명의 후보자를 대상으로 한 실험 저는 게이트를 결정적인 Node.js 장치로 암호화했습니다. 각 후보가 내린 점수를 향상시킵니다. 그들은 오직 운영 증거에만 차이가 있다. 이 장비는 7개의 검사를 평가합니다. 1. 리소스, 메인, 데이터 세트 스냅샷, 평가자 등이 고정되어 있습니다. 2. 완공된 모든 배포는 예상되는 기간의 전체 커버링을 가지고 있습니다. 3. 예기치 않은 재시험 빚은 0이 됩니다. 4. 지원자는 잠금된 홀딩에서 정확한 부모를 이길 수 있습니다. 5. 보호된 사건의 회귀가 없습니다. 6. 모든 제한된 카나리 임무는 검증된 결과와 기록된 유해 효과가 없습니다. 7. 롤백이 해결되고 테스트되었고, 권한이 있는 배우가 그 단계를 승인했습니다. 그 출력은 의도적으로 불편합니다. 가장 큰 상금은 손실입니다. C 후보자는 0.10으로 개선됐지만 3개의 보호 사례를 깨고 있습니다. 지원자 B는 0.08으로 향상되지만 120개와 14개의 예상치 못한 재 시도 중 83개의 완전 스탠드 롤러를 가지고 있습니다. 응시자 D는 0.07으로 개선되지만 20개의 카나리아 결과 중 18개를 확인하고 부모를 해결하거나 테스트할 수 없습니다. A 후보자는 일곱 검사 모두 통과하지만 그 판결은 의도적으로 PROMOTE TO BOUNDED CANARY , 모든 곳에 safe 또는 deploy이 아닙니다. 실행 가능한 유물과 기계로 읽을 수 있는 출력은 논문을 거짓으로 만들 수 있습니다. 한 필드를 변경하고 다시 실행하고 실패한 체크를 검사하십시오. 이 정책은 디자인적으로 엄격하지만, 그 임대점은 시사에서 숨겨진 것이 아니라 실제 작업 흐름에 대한 버전으로 만들어질 수 있습니다. 지속적인 학습은 신선함 규칙이 필요합니다. 에이전트 라이트닝의 문서에서는 온라인 또는 지속적인 학습 모드를 설명하기도 합니다. 런어는 기회주의적으로 출범과 범위를 보고할 수 있으며, 알고리즘은 새로운 증거를 조사하고 충분한 데이터가 도착하면 리소스를 업데이트 할 수 있습니다. 그 루프는 신선함을 올바름의 일부로 만듭니다. 후보가 개선되었다는 데시보드는 데이터 절단, 평가자 버전, 리소스 마인터 및 카나리 창의 이름을 지정하지 않고 재구성할 수 없는 결론을 제시하고 있습니다. 두 가지 포인터를 사용하세요: latest candidate resource 는 알고리즘이 업데이트를 만들 때마다 진행될 수 있습니다. approved default resource 는 완전한 업데이트 영수증을 통과한 후에만 진행됩니다. 절대 별명으로 부르지 마 승인된 결제 신청을 하는 소비자는 가장 새로운 후보를 침묵으로 받아들이지 않아야 합니다. 또한 오래된 증거 규칙을 정의합니다. 평가자, 도구 계약, 작업 분포 또는 부모가 게이트가 실행된 후 변경되면 영향을 받은 체크를 무효로 설정합니다. 이전 카나리에는 새로운 허가, 목적지, 모델 서버 또는 재실험 정책이 자동으로 적용되지 않습니다. 장기 훈련에 있어서, 정지 조건은 보상 조건과 함께 있습니다. 랜드 커버리가 떨어지면 잠시 멈추거나, 빚이 그 경계를 넘어서면 다시 시도하거나, 보호된 집합이 회귀하거나, 부모가 사용할 수 없게 되거나, 카나리는 외부 효과를 확인할 수 없습니다. 트레이너가 여전히 활동중입니다. 프로젝트 의 명시한 경계를 존중하라 프로젝트의 커밋 스핀 책임 있는 AI 문서는 에이전트 라이트닝을 연구 중심으로 묘사하고 상업적 또는 실제 사용 전에 추가 테스트를 촉구하고 위험 높은 의사결정 맥락에 대해 조언합니다. 또한 정확성, 안전성, 공정성, 개인 정보 보호, 데이터 세트 권리 및 인간의 감독을 채택자에게 맡깁니다. 업데이트 게이트는 그 책임을 지원하고, 그것을 처리하지 않습니다. 이 장치는 개방된 안전성을 증명할 수 없으며, 모든 분포 변화를 감지할 수 없으며, 다른 언어 또는 규제된 영역의 작은 영어 카나리어를 대표할 수 없습니다. 그 유익한 약속은 좁습니다. 보상이 긍정적이지만 증거가 부족한 업데이트는 검증 가능한 이유로 격리되어 있습니다. 그 결과 운영 규칙은 간단합니다. 라이트닝 요원이 후보자를 최적화하도록 허용하지만, 프로모션을 별도의 증거에 근거한, 되돌릴 수 있는 결정으로 만들도록 하죠. 러너알고리듬의 경계를 가시적으로 유지하고 정확한 부모를 보존하고 훈련 전에 예상된 증거를 선언하고 실제 카나리 결과를 확인하고 기본 변경 전에 권한을 요구합니다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 그 제품 방향은 에이전트 건강, 접근성, 유용한 진보, 도구 접근성, 결과, 비용, 증거 및 안전한 승인 경계에 관한 것입니다. 그러나 생산 에이전트 라이트닝 모니터링은 여기에 배송된 통합으로 제시되지 않습니다.