2026-08-01T08:39:08.245Z

エージェント・ライトニング 捜査官に届く前に RLの更新をすべて削除する

エージェント・ライトニングの展開 賞与 成果 承認 裏付けのゲートに

論文 エージェントライトニング:強化学習によるAIエージェントを訓練する は重要なエンジニアリング質問に答えます RLループを再構築せずに既存のエージェントが訓練データをどのように生成できるのか? 新たに訓練されたリソースが実際のワークフローに影響を与えるべき時期は? 安全なデフォルトは 新しいモデルや 提示されたリソースを 候補として保持することです 更新プログラムに 準確な親,データスナップショット,評価者,展開試行,追跡カバー,保護されたケース,制限されたカナリー結果,承認,テストされたロールバックが追加された後のみ 宣伝します より高い報酬は有用な証拠ですが 健康的な判断ではありません その境界線は その枠組みに 適合するのではなく 戦うのです エージェント・ライトニングは既に 学習アルゴリズムから エージェントの実行を 切り離している その分離を解放の門として守ってください エージェント・ライトニングが記録していることと その記録が証明していること 紙はエージェント・ライトニングを RL訓練からエージェントの処刑を切り離す方法として紹介しています マルコフ決策プロセスとしてエージェント実行をモデル化し,クレジット割り当てモジュールを通じてエージェント経路をトレーニング移行に変換し,テキスト to SQL,リトリーブル 拡張生成,数学ツールの使用に関する実験を報告します. 現在のプロジェクトドキュメントは,操作者により具体的な名詞を与えます. Resource は,アルゴリズムはモデルまたはプロンプト・テンプレートなどの更新が可能な資産である. Rollout は,資源に対して実行された作業の単位である. Attempt は,再試算を含むその展開の1回の実行である. Span は,実行から発生した出来事や痕跡を記録する. Reward は,展開の期間に添付された数値判断である. LightningStore は,エージェントを実行するランナーを,証拠を消費し,リソースを更新するアルゴリズムに接続します. これは強力なトレーニングインターフェースです 完全解放領収書ではありません 4 回の試行が必要だった. 最終的な報奨はうまく見えますが 再試では 決定不整,コスト借金,または依存が間接的に失敗していることが明らかになります 2回目の展開は高い報酬を得られるが,予想される範囲の31%が欠けている. 破壊的なツール呼び出しを防ぐ唯一の保護されたケースを壊しながら,平均評価スコアを向上させることができます. 失敗は違います 記録 役に立つ質問に答えます 疑問は,それだけでは答えません 展開 どんな任務を試みたのか? 意図された外部結果は存在していたのか? 試行錯誤 処刑 は 何度 起こっ て い まし た か 最後の成功は安定していたのか それとも単なる幸運だったのか? スパン どんな 道具 の 出来事 が 観察 さ れ まし た か 重要な 道具のない効果は正しいのか? 報奨 裁判官が 行動にどう影響を与えたのか? 保護された行動,プライバシー,そして反転は 完ぺきだったか? 資源更新 どんな モデル や 提示 が 入手 さ れ まし た か. そのリソースはデフォルトになるべきか? 公式アーキテクチャは,ランナーが部署権限にならずに アルゴリズムがスパンから学び,リソースを更新できるようにするからです. これは特徴です 最新資源 を 承認された資源として扱って削除しないでください. 訓練の更新を1つの領収書に載せ 3つの段階で組み立てられた単一の変更できない更新領収書を使用します. 領収書は ライトニングストアの記録に 接続する 安定した識別子を保存する限り エージェント・ライトニングの外に存続できます 訓練前:アイデンティティと権威を凍結する 候補者リソース ID,その正確な親資源 ID,トレーニングデータ・スナップショット,保存されたデータ・スナップショット,評価者バージョン,アルゴリズム構成,コード修正,および意図された範囲を記録する. カナリーを承認できるアクターと,そのリソースをデフォルトにすることができるアクターを記載する. 両親は まだ荷付けできる道具に 決まなければなりません 最新更新は,継続的な学習が教科書の作成以来,3つの新しいリソースを生み出した場合,逆転目標ではありません. 評価者,保護されたケース,プロモーションポリシー,およびロールバック履歴を学習者の書き込み可能な表面の外に保管します. そうでない場合,最適化者は行動ではなくルールを変えることで,明らかなスコアを向上させることができます. 訓練期間: 試行事と証拠の説明 承認された訓練と検証ウィンドウの各部署については,以下のものを保持する. 精確なスペンファミリーは ワークフローに依存します インバリアントは名前よりも重要です 結果を見る前にどのような証拠が存在すべきかを宣言し,その後,欠けている証拠が不可用であると報告します. 欠席を健康的な価値に変えてはならない. 試みは 勝負に値する 完成した試みと14回の沈黙の失敗は 一回完成した展開に等しくありません 訓練前に再試予算を決定し,予期された再試試をインフラ再試から区別し,すべての試みの理由を保持する. 訓練後: 学習成功は運用入学から分離 まず 候補者と親を 閉じ込められたホールダウトで比較します 総合的な結果を報告し,保護されたケースファミリーにゼロ寛容性または制限された予算を設定する. 次に,指定されたタスク,時間,ツール,コスト,および副作用の限界を超えないカナリーで候補者を実行します. カナリー領収書には 目的地が確認されるべきで 命令だけではありません もしエージェントがファイルを作成するはずだったなら 期待されたパスに問い合わせ,その内容を検証する. チケットを更新するなら チケットを返して読む 決定的に効果を検証できない場合は,弱い判事や人間の証拠とその不確実性を記録してください. 最後に テストを戻します 同じ境界環境に正確な親を載せ ルーティングがそこに戻れることを証明します 次のステップを承認する権限のある人間または政策による解放役員のみです 4人の候補者による実験 Node.jsの固定装置としてゲートをコードしました 各候補者は 勝ち点を向上させる. 運用証拠のみで異なっています. 装置は7つのチェックを評価する. 1. リソース,マザー,データセットのスナップショット,およびエバレーターがピッナインされます. 2. 完成したすべての展開は,期待される期間を完全にカバーしている. 3. 予期せぬ再試負債はゼロである. 4. 候補者は,ロックされたホールドアウトで正確な親を倒す. 5. 保護されたケースの退却はなく, 6. 制限されたカナリー任務は,確認された結果を持ち,有害な影響が記録されていない. 7. ロールバックが解決され テストされ 権限のある俳優が ステップを承認しました その出力は意図的に不都合です 最大の報酬は負ける. 候補Cは0.10で改善しましたが 3つの保護されたケースを破りました 候補Bは0.08倍も改善しましたが 120回のテストのうち 83回の完全展開と 14回の予期せぬ再テストのみです 候補Dは0.07で改善するが,20のカナリー結果のうち18件しか確認できず,その親を解決したりテストすることもできません. 候補Aは7つのチェックをすべて合格しますが,その判決は意図的に PROMOTE TO BOUNDED CANARY , safeまたは deployどこにでもありません. 実行可能なアーティファクトと機械で読み取れる出力は論文を偽造可能にする. 1つのフィールドを変更して 再起動して チェックが失敗したチェックをチェックします この政策は設計的には厳格ですが 文献で隠されたのではなく リアルなワークフローのために 限界値がバージョン化できます 継続的な学習は新鮮さに関するルールが必要です エージェント・ライトニングのドキュメントではオンラインまたは継続的な学習モードも記述されています. ランナーは機遇的に展開と展開を報告し,アルゴリズムは新しい証拠を調査し,十分なデータが到着するとリソースを更新することができます. そのループは フレッシュさを 正しさの一部にします データのカットオフ,評価者バージョン,リソースマザー,カナリーウィンドウの名前を付けずに"候補が改善した"というダッシュボードは 再構築できない結論を示しています. 2つの指針を使用します latest candidate resource は,アルゴリズムは更新を作成するたびに,前進することができる. approved default resource は,完全な更新の領収書が通過した後のみ前進します. 偽名で呼ばない 承認されたデフォルトを要求する消費者は,最新候補者を黙って受け取るべきではない. また 証拠が時代遅れになる規則を定義する ゲートが実行された後,評価者,ツール契約,タスク配分,または親が変更された場合,影響を受けたチェックを無効にします. 前回のカナリーでは,新しい許可,目的地,モデルサーバー,またはリトライポリシーを自動的にカバーしません. 長期訓練では ストップ条件は 報酬条件に加えて スパンカバーが下がり 債務が限界を越えたり 保護されたセットが下がり 親が利用できなくなったり 外部効果を確認できないとき 停止します 訓練者はまだ活動している 活動を表すのではなく,有用な進歩を表す. プロジェクトに定められた境界を尊重する プロジェクトのコミットメントによる責任あるAI文書は,エージェント・ライトニングを研究型と記述し,商業的または現実的な使用前にさらなるテストを要請し,リスクの高い意思決定環境に対して助言しています. また,下流の正確性,安全性,公平性,プライバシー,データセットの権利,および人間の監督を採用者に任せています. アップデートゲートは,その責任を支えるが,それを免除しない. この装置は,無制限の安全性を証明したり,分布の変化を検出したり,他の言語または規制ドメインの小さな英語のカナリー代表者を作ったりすることはできません. 報奨率が高いが,証拠が不足している更新は,検証可能な理由から隔離されている. 実行規則は簡単です ライトニング捜査官が候補者を最適化させ 昇進を 証拠に基づいた 逆転可能な決定にします ランナーアルゴリズムの境界線を表示し,正確な親を保持し,訓練前に期待される証拠を宣言し,実際のカナリー結果を確認し,デフォルトを変更する前に権限を要求する. Sidewisp は現在プライベートプレビュー段階です。 製品指針はエージェントの健康可用性,有用な進歩,ツールアクセス,結果,コスト,証拠,安全な承認の境界だが,生産エージェントの雷の監視は,ここに送料された統合として提示されていない.