2026-08-01T10:18:40.911Z

자기 개선 AI 에이전트: 변화를 촉진하고, 자기 편집을 하지 마십시오

제안된 모든 행동 변화를 얼어붙이고, 정확한 부모와 비교하고, 회귀 예산을 보호하고, 권위와 반향을 쓸 수 있는 루프에서 벗어나도록 한다.

자기 개선하는 AI 에이전트는 라이브 동작을 다시 작성하지 않아서 다시 작성하는 진전을 호출해야 합니다. 더 안전한 기본은 제안된 모든 프롬프트, 메모리, 검색, 도구 정책 또는 코드 변경을 신뢰할 수 없는 출시 후보로 취급하는 것입니다. 후보자를 동결하고, 편집할 수 없는 증거에 대한 정확한 부모와 비교하고, 보호된 매트릭을 확인하고, 누가 승인할 수 있는지 증명하고, 해결 가능한 롤백 목표를 유지하십시오. 그런 다음만 작은 돌이킬 수 있는 변화가 한정된 카나리아에 들어갈 수 있습니다. 그 규칙은 여전히 개선할 수 있습니다. 신뢰의 단위를 변화시킵니다. 피드백은 자동으로 후보자를 생성할 수 있습니다. 활성화는 증거가 필요합니다. 이 구별은 중요한 이유는 자기개발은 모델 교육 이상의 것을 포함하기 때문입니다. 반성는 에피소디컬 메모리에 구사적인 피드백을 저장하기 때문에 체중 업데이트 없이 후속 실험은 다르게 행동합니다. 자기 정화는 동일한 모델을 사용하여 피드백과 정밀화를 대체합니다. 라우팅 명령어, 검색된 교훈, 도구 허용 목록, 또는 쓸 수 있는 스크립트는 새로운 체크포인트처럼 다음 실행을 확실히 바꿀 수 있습니다. 그 모든 표면을 덮어야 합니다. 측정하기 전에 후보자를 얼어 넣으십시오. 두 가지 변함없는 정체성부터 시작하세요. 활동적인 부모와 후보자입니다. 유용한 변화 선언 기록: 소화가 평가와 카나리 사이의 조용한 편집을 방지합니다. 부모 아이덴티티는 agent v41 에 대해 생성된 후보자가 현재 활성화된 agent v42 에 승격하는 것을 방지합니다. 글래스 가능한 표면 목록은 실제 폭발 반경을 보여줍니다. 기념 수업으로 묘사된 제안은 그 과정이 평가자 또는 당국 정책도 편집할 수 있다면 그렇게 작지 않습니다. 지원자가 자신의 홀도아웃 케이스, 점수 코드, 수용률, 승인 정책 또는 롤백 역사서를 작성하도록 허용하지 마십시오. 저게 룰러, 잠금, 응급 출구입니다. 그들을 변화시킬 수 있는 요인은 업무를 개선하지 않고 점수를 높일 수 있습니다. 이 또한 첨부 파일 학습 파일의 버전화가 필요한 이유입니다. 짧은 수업은 후속 실행마다 검색을 다시 방향을 잡거나, 격화를 억제하거나, 편향 도구 선택을 할 수 있습니다. 메모리 변경만 함은 저장 메커니즘을 설명하고, 운영 위험은 아닙니다. 잠금된 증거에 따라 정확한 부모와 후보자를 비교하십시오. 절대적인 후보 성적은 약한 증거입니다. 부모와 후보자를 동일한 케이스 ID, 환경 버전, 도구 장치, 무작위성 정책 및 결과 검증자에 대해 실행하십시오. 복합된 결과를 저장하세요. 문제는 후보자가 0.86점을 얻었는가? 부모와 비교해 어떤 경우에, 어떤 비용으로 변화가 있었는가? OpenAI 자발적인 요원 요리책는 기본 라인, 인간 또는 모델 피드백, 평가, 점수 문턱, 재실험 제한 및 업데이트 된 기본 라인과 함께 실용적인 루프를 보여줍니다. 그것은 후보자를 생성하고 측정하는 데 유용한 기계입니다. 생산 촉진 결정은 하나의 집합적 임대보다 엄격한 경계가 필요합니다. 왜냐하면 평균은 이득을 위해 지불한 재산이 숨겨져 있기 때문입니다. 작업 성공이 0.80 에서 0.89 로 상승하고 도구 효과의 무결성이 0.99 에서 0.96 로 떨어지는 것을 가정합니다. 평균은 상승할 수 있습니다. 이 변경은 여전히 실패합니다. 이중 또는 실종된 외부 효과는 허용되지 않습니다. 대상 매트릭과 보호 매트릭을 명시적으로 표시하십시오. 메트릭 방향 프로모션 규칙 임무의 성공 더 높은 지원자는 적어도 0.03 로 향상되어야 합니다 도구 효과의 무결성 더 높은 회귀가 허용되지 않습니다. 승인 라우팅 더 높은 회귀량은 0.02 를 초과할 수 없습니다 검증된 결과별 비용 하위 증가량은 0.05 를 초과할 수 없습니다 관찰 가능한 결과와 연결된 매트릭을 사용하십시오. 0에서 출발한 명령은 전달가능성이 있다는 증거가 아닙니다. 트레이스를 통해 통화를 하는 것은 목적지가 정확히 한 번 바뀌었다는 증거가 아닙니다. 모델 판사는 주관적인 품질에 도움을 줄 수 있지만 결정적 파일, 데이터베이스, 허가 또는 효과 검사를 초과해서는 안됩니다. 잠금된 세트는 알려진 오류와 유효한 대기량을 포함해야 합니다. 그렇지 않으면 에이전트가 더 공격적인 것으로서 개선되는 것처럼 보일 수 있습니다: 더 적은 격화, 더 적은 질문, 더 빠른 완료, 더 많은 잘못된 부작용. 후보자가 직접적으로 최적화하지 않는 범위를 벗어나는 최소한 한 가지 조치를 포함하십시오. 활성화 기관과 별도의 제안 권한 에이전트가 변화를 제안할 수 있게 하는 것은 그것을 활성화할 권한이 없다는 것을 의미하지는 않습니다. 표면과 폭발 반경에 따라 승인을 정의하십시오. 작은 패스트 라우팅 변경은 미리 승인된 정책에 따라 20개의 작업에 들어갈 수 있습니다. 검색 정책이나 도구 정책 변경은 이름을 붙인 사람이 필요할 수 있습니다. 런타임 코드, 평가자 논리, 자격정지 범위 및 돌이킬 수 없는 행위는 자동 프로모션에서 제외되어야 합니다. OWASP의 과도한 기관 지침는 최소한의 허가, 하류 허가, 그리고 인적 승인을 높은 영향을 미치는 행동으로 권장합니다. 자기 수정에도 동일한 분리법을 적용한다. 개선 과정은 후보 유물을 작성하는 데 필요한 능력만을 얻을 수 있습니다. 다른, 더 작은 구성 요소는 평가와 홍보를 소유하고 있습니다. 유용한 당국의 영수증은 다음과 같습니다. 실제 실행에 옮기기 위해 인증을 후보자의 소화에 적용합니다. 그 기간이 만료됩니다. 실행 가능한 허가로 에이전트가 자신을 개선할 수 있다는 것을 받아들이지 마십시오. 그것은 표면, 제한 및 시간 경계가 없습니다. 승인을 기다리는 것은 실패가 아닙니다. 증거가 통과하지만 표면 변경이 사람을 필요로 하는 경우, 후보 소화, 측정된 델타, 요청된 표면, 롤백 목표 및 제안된 카나리아 크기를 가진 AWAITING APPROVAL 를 반환하십시오. 그 기다림의 주인이 있고 재개될 수 있는 결정이 있을 때 실행은 건전하다. 정해진 순서로 게이트를 실행하라 질서가 그 결과를 설명할 수 있게 해준다. 점수를 토론하기 전에 구조적인 문제를 거부합니다. 1. IDENTITY: 소화가 유효하고, 후보자의 부모는 여전히 활동하고 있습니다. 2. 보호된 표면: 후보자는 테스트, 보유 데이터, 권한, 롤백 역사 또는 다른 금지된 표면을 작성할 수 없습니다. 3. 복합 증거: 부모와 후보자는 동일한 잠금된 증거 집합을 사용했습니다. 4. 회귀 예산: 모든 보호 메트릭은 자체 한계 내에서 유지됩니다. 5. Rollback: 이름의 이전 버전은 여전히 해결됩니다. 6. 물질 이득: 목표 개선은 미리 선언된 바닥을 제거합니다. 7. A권: 영수증은 표면과 카나리 한계에 해당한다. 첫 번째 5개의 게이트는 안전과 감사성을 보호합니다. 물질적 이득은 을 방지한다: 소음을 일으키는 변화이지만 유용한 개선이 이루어지지 않아야 하며, 단순히 안전 검사를 통과했기 때문에 촉진되어서는 안 된다. 당국은 카나리 준비 및 인간 검토 중 하나를 결정합니다. 동반 장치는 모델 호출 없이 그 우선순위를 구현합니다. 문서 유물 디렉토리에서 실행하세요: 8명의 후보들은 의도적으로 믿을 수 있는 성공 이야기를 공유합니다. 대부분의 후보들은 목표 점수를 높인다. 그들의 결정은 다릅니다. 지원자 결정 결정적인 증거 안전 패스트 패치 CANARY READY 복합적인 이익, 보호된 회귀가 없습니다, 제한된 자동차 권한 검색 변경 AWAITING APPROVAL 증거는 지나고 표면은 사람을 필요로 한다 작은 기억 수업 HOLD NO MATERIAL GAIN 안전하지만 목표 이득은 0.01 입니다 낡은 부모 BLOCKED IDENTITY 후보자는 잘못된 활성 기준에서 생성되었습니다. 평가자 작가 BLOCKED PROTECTED SURFACE 후보자는 통치자를 바꿀 수 있습니다. 새로운 개인 사건 BLOCKED EVIDENCE 지원자는 잠금된 세트를 사용하지 않았습니다. 합계 승자 BLOCKED REGRESSION 도구 효과의 무결성은 0.03 로 떨어졌다 사라진 오래된 버전 BLOCKED ROLLBACK 이름 붙여진 롤백 유물은 사용할 수 없습니다 유용한 결과는 복합 안전 점수가 아닙니다. 그것은 한 상태와 한 수리 경계입니다. 노후한 부모들은 재생이 필요합니다. 보호된 회귀는 진단이 필요합니다. 실종된 롤백 목표가 유물 복원이 필요합니다. 그 실패를 평균하는 것은 소유권을 숨기게 될 것입니다. 카나리아의 변화는 당신의 자신감이 아닙니다. 오프라인 게이트를 통과하면 후보자가 카나리어를 받을 수 있습니다. 생산 건강은 증명되지 않습니다. 과제, 시간, 지출, 도구, 부작용을 제한하십시오. 부모를 이용하실 수 있도록 하세요. 카나리아를 운행하는 것은 독립적으로 검증할 수 있는 결과일 뿐이다. 실시간 영입을 작업량이 허용하는 동시 또는 최근의 부모 기준과 비교하십시오. 활성화 전에 반전 트리거를 정의하십시오: 보호 메트릭 위반, 알려지지 않은 결과율, 복제 효과, 결여 승인, 지출 천장 또는 증거 신선성 실패. 롤백은 정확한 원자 유물을 복원하고 의도된 작업 결과를 반환하는지 확인하는 것을 의미합니다. 완료된 롤백 명령은 활동이 아니라 복구입니다. 카나리 후 세 개의 기록을 보관합니다. 변함없는 후보자와 부모 소화; 가동된 오프라인 및 카나리아 증거, 가동되지 않는 신호를 포함하여; 승진, 정지, 승인 또는 반발 결정과 함께 당국의 수신. 증거가 사라진다면 UNCERTAIN 를 돌려보내고 승진을 중단하세요. 없는 매트릭을 건강한 값으로 변환하지 마십시오. 동일한 제안이 반복적으로 실패하면, 제한이 제한되지 않은 시간과 토큰을 소비하는 개선 루프가 허용되는 대신 다시 시도하고 사람에게 전달합니다. 이 게이트가 증명할 수 없는 걸 알아 제공된 감사는 명백한 형태, 우선순위, 결합된 메트릭 델타, 권한 범위를 확인하고 반발 해상도를 확인합니다. 그것은 당신의 지연이 생산을 나타낸다는 것을 증명하지 않습니다. 인간의 라브릭이 옳다는 것을 증명하지 않습니다. 또는 20개의 카나리 작업에서 희귀한 실패가 나타날 것입니다. 검사는 쓸모가 없어질 수 있습니다. 평가자들은 모델의 맹점을 공유할 수 있습니다. 지원자가 합격한 후 외부 도구가 변경될 수 있습니다. 따라서 실질적인 기본은 제한됩니다: 후보자를 자유롭게 생성하고, 저 위험 평가를 신중하게 자동화하고, 명시적인 권위 범위에만 활성화를 자동화합니다. 고 충격과 돌이킬 수 없는 표면은 인간 승인된 상태로 유지하십시오. 프로모션 후에도 계속 모니터링 해야 합니다. 왜냐하면 자기개선을 하는 에이전트는 유용한 결과물이 건강하게 유지될 때만 건강할 수 있기 때문입니다. Sidewisp는 현재 비공개 프리뷰 단계입니다. 그 방향은 증거, 승인을 제한하고 결과 검증으로 기존의 에이전트 실행 시간을 중심으로 건강 계층을 추가하는 것입니다. 생산 모니터링 어댑터 및 복구 시스템은 일반적으로 배송되지 않습니다. 만약 그 경계가 에이전트를 어떻게 운영하는지 일치한다면, 당신은 개인 미리보기에 참여를 할 수 있습니다.