2026-08-01T10:18:40.143Z

自己改善AIエージェント:変化を促し,自己編集をしない

提案された行動変更をすべて凍結し,その正確な親と比較し, 逆転予算を保護し,権威とロールバックを書き込みループの外に保つ.

自動改善するAIエージェントは,その行動を再書き,再書きの進捗を呼び出すべきではない. 提案されたプロンプト,メモリ,リクエスト,ツールポリシー,またはコード変更はすべて 信頼できないリリース候補として扱うのが安全です 候補者を凍結し 編集できない証拠に その正確な親と比較し 保護されたメトリックをすべてチェックし 誰が承認できるかを証明し 解決可能な ロールバック目標を維持します 限られたカナリアに 微小で逆転可能な変化が 入り込むことができるのです その規則は改善を許す. 信頼関係が変わります フィードバックは自動的に候補者を生成できます 活性化には証拠が必要です 差別は重要だ なぜなら"自己改善"はモデル訓練以上の内容をカバーしているからです 思考は,エピソード記憶に口頭反響を保存し,体重更新なしで後の試験が異なる行動をとる. 自己 浄化は,同じモデルを使用してフィードバックと洗練を交代する. ルーティングプロンプト,取られたレッスン,ツール許可リスト,または書き込み式スクリプトは,新しいチェックポイントのように次の実行を確実に変えることができます. 変更帳は その表面をすべてカバーしなければならない. 測定前に候補を凍結する 2つの不変なアイデンティティから始めましょう 活躍する親と候補者です 有用な変更マニフェスト記録: 評価とカナリアの間の静かな編集を防ぐ. agent v41 に対して生成された候補者が現在有効な agent v42 に昇進することを防止する. 表面のリストは実際の爆発半径を示しています 評価者または権限政策を編集することも可能であれば 記憶のレッスンとして説明される提案はそれほど小さいものではありません. 候補者が チェックアウトケース,スコアコード,承認基準,承認方針,ロールバック履歴を 書き留めてはいけません. 鍵と緊急出口です 変えられるエージェントは 任務を改善することなく スコアを上げることができます 追加のみの学習ファイルがバージョン化に値するのもこのためです 短いレッスンは 追いつきをリダイレクトしたり 増幅を抑制したり 偏見的なツール選択を 後で実行するたびに行うことができます 記憶力変更のみ 存储メカニズムを記述し,運用リスクではない. ロックされた証拠で正確な親と候補者を比較する 候補者の絶対スコアは 証拠の弱さです 同じケースID,環境バージョン,ツールフィッチャー,ランダム性ポリシー,結果検証器を対象に親と候補者を実行します. 組み合わせた結果を保存する 候補者が0.86点だったのか? 両親に対して何が変わったのか,どのケースで,どのコストで変化したのか? OpenAI 自転進化剤の料理本は,ベースライン,人間またはモデルフィードバック, evals,スコアしきい値,再試用制限,および更新されたベースラインを含む実用ループを示します. これは候補者を生成し測定するための有用な機械です 生産促進決定には,合計の限界よりも厳しい境界線が必要である. なぜなら,平均は,利益のために支払った財産を隠しているからです. 0.80 から 0.89 に上昇すると,ツール効果の整体性は 0.99 から 0.96 に低下すると仮定します. 平均は上昇するかもしれない. 複製または欠落した外部効果が受け入れられない場合,変更は依然として失敗します. 対象メトリックと保護メトリックを明示する. メトリック 方向 昇進規則 任務の成功 高い 候補者は少なくとも 0.03 で改善しなければならない ツール効果の整体性 高い 逆転は許されない 承認路線 高い 逆転は 0.02 を超えない 検証された結果に対するコスト 下部 増加は 0.05 を超えない 観測可能な結果に関連したメトリックを使用します. ゼロから出たコマンドは 引き出物がある証拠ではありません. 追跡するツール呼び出しは 目的地が1回変更されたという証拠ではありません モデル判事は主観的な質で助けることができますが 決定的なファイル,データベース,許可,または効果チェックを覆すべきではありません. ロックされたセットには,既知の故障と有効な待機が含まれます. そうでない場合 薬剤は より攻撃的になり より少ないエスカレーション 疑問が少ない 完成が速い 副作用が増えるように見えるかもしれません 候補者が直接最適化していない範囲外の少なくとも1つの測定を含める. アクティベーション機関から別々の提案権限 代理人が変更を提案しても その変更を活性化させる権限は 与えられない. 表面と爆発半径によって承認を定義する. 20タスクのカナリーに 早期承認されたポリシーで 簡単な速引変更が 入れられるかもしれません 復旧政策またはツール政策の変更には,人の名前が必要になる可能性があります. 実行時間コード,評価者論理,認証範囲,および不可逆なアクションは自動プロモーションの外に留まるべきである. OWASPの過剰な機関指針は,最小限の許可,下流許可,および高影響行動の人間の承認を推奨します. 自動修正に同じ分離を適用する. 改良プロセスは 候補のアーテファクトを書くのに必要な能力のみを得ます 評価と推進を対象とする 異なる小さな構成要素があります 有用な権限領収書には: 領収書を実際の実施で候補者消化に拡大する. 期限切れだ 実行可能の許可として 代理が自己改善を可能とする. 表面,制限,時間制限がない. 承認を待つことは失敗ではありません 証拠が通過するが,表面の変更が人を必要とする場合,候補の消化,測定されたデルタ,要求された表面,ロールバックターゲット,提案されたカナリアサイズを含む AWAITING APPROVAL を返してください. 実行は健康的なものです 待機は主持者と 再開可能な決定がある場合です ゲートを固定順に運ぶ 秩序は結果を説明できる. 構造上の問題を議論する前に拒絶する: 1. IIDENTITY: 消化物は有効で,候補者の親はまだ活動している. 2. 保護された表面: 候補者はテスト,保持データ,権限,ロールバック履歴,または他の禁止された表面を書き込むことはできません. 3. 組み合わせた証拠: の親と候補者は同じロックされた証拠セットを使用した. 4. 退却予算: 保護されたメトリックはそれぞれその限界内に残る. 5. Rollback: 名前前のバージョンはまだ解決している. 6. 物質の獲得: 目標の改善は,前もって宣言された床をクリアします. 7. A権限: 領収書は表面とカナリアの限界に一致する. 最初の5つのゲートは 安全性と監査性を保護します 物質の増殖は,を防ぐ:騒音を生む変化が,有用な改善が起こらないことであって,安全チェックを合格しただけで促進されるべきではない. カナリー・レディとヒトのレビューを決定する 同伴装置は,モデル呼び出しなしでその優先順位を実装します. 記事のアーティファクトディレクトリから実行します: 8人の候補者は 意図的に成功の物語を共有し 大半は目標スコアを上げています 彼らの決定は違います 候補者 決定 決定的な証拠 安全なプロンプトパッチ CANARY READY 組合せ利益,保護された回帰がない,制限された自動認証 復元変更 AWAITING APPROVAL 証拠は過ぎ去ります 表面は人を必要とします 小さな記憶のレッスン HOLD NO MATERIAL GAIN 安全だが 目標の利益は 0.01 ステイラー親 BLOCKED IDENTITY 候補は誤ったアクティブベースラインから生成されました 評価者 執筆者 BLOCKED PROTECTED SURFACE 候補者は支配者を変更することができます 新しく私事 BLOCKED EVIDENCE 候補者はロックセットを使用しなかった 総勝者 BLOCKED REGRESSION ツール効果の整体性は 0.03 によって低下した 古いバージョンが欠落した BLOCKED ROLLBACK 名前のロールバックアーティファクトは利用できません 有用な結果は 複合 安全スコアではありません. 時代遅れの親は再生を必要としている. 保護された後退は 診断が必要です 失われた反転標的は 遺物復元が必要だ 平均的な失敗は 財産を隠すことになる カナリー 変化,あなたの自信ではない オフラインゲートを通過すると 候補者がカナリーに適格になりますが 生産の健康性を証明するものではありません 作業,時間,支出,道具,副作用を制限する 両親を利用できるようにしてください. カナリアの経路は 単独で検証できる 唯一の作業です 作業負荷が許容する場合,現行のまたは最近の親基線との直線領収を比較する. 活性化前に反転トリガーを定義する:保護メトリック違反,未知の結果率,重複効果,未承認,支出上限,または証拠新鮮性障害. ロールバックとは,正確な元器を復元し,意図された作業結果が返ってくるかどうかを確認することを意味します. 完了したロールバックコマンドは アクティビティではなく 回復です カナリアの後に3つの記録を保存する 変えない候補者と親の消化器; 配列されたオフラインおよびカナリア証拠,利用できない信号を含む. 昇進,延期,承認,または反転決定とその権限の領収書. 証拠が消えたら UNCERTAIN を返して 昇進を止めろ 欠席したメトリックを健康値に変換しないでください. 同じ提案が繰り返し失敗した場合,改善ループが無制限の時間とトークンを消費する代わりに,キャップを再試し,人を対象にします. このゲートが証明できないことを知れ 提供された監査は,表形,優先度,ペアメトリックデルタ,権限範囲,およびロールバック解像度を検証する. 20つのカナリータスクで 稀な失敗が現れるという証拠ではありません テストは時代遅れになるかもしれません 評価者はモデルの盲点を共有できます 候補者が合格後,外部ツールが変更されます. したがって,実用的なデフォルトは制限されています. 候補者生成を自由に自動化し,低リスク評価を慎重に自動化し, 公開権限の範囲内でのみアクティベーションを自動化します. 高影響で逆転できない表面を人間承認に保つ. 昇進後も監視を続けます 自改善剤は,有用な結果が健康に維持される時のみ健康であるため,更新パイプラインが忙しい時ではありません. Sidewisp は現在プライベートプレビュー段階です。 その方向は,証拠,承認境界線,および結果検証を含む既存のエージェントの実行時間周辺に健康層を追加することであり,生産モニタリングアダプタと回収システムは一般的に出荷されません. もしその境界線が 代理人を操作する方法と一致するなら プライベートプレビューに参加するとできます