2026-08-01T08:39:06.730Z
Агент Лайтнинг: отключите все обновления РЛ до того, как они достигнут агента
Превратите развертывание агента Молнии, сроки, награды, канарные результаты, одобрение и обратное в подтвержденные доказательства ворота для каждого подготовленного ресурса.
В статье Агентная молния: обучение любых агентов AI с усилением обучения отвечает на важный инженерный вопрос: как существующий агент может генерировать данные о тренировке, не будучи восстановленным вокруг петли RL? Он не отвечает на вопрос об освобождении, который следует задать следующим образом: когда следует позволить новообразованному ресурсу влиять на реальный рабочий процесс? Безопасным дефолтом является сохранение каждой новой модели или ресурса в качестве кандидата. Продвигайте его только после того, как вы сможете присоединиться к обновлению к его точному родителю, снимку данных, оценщику, попыткам развертывания, охране следов, защищенных случаев, ограниченных канарных результатов, одобрения и проверенной обратной версии. Более высокая награда это полезное доказательство, но это не медицинский приговор. Эта граница соответствует рамке, а не борьба с ней. Агент Лайтнинг уже отделяет исполнение агента от алгоритма обучения. Сохраните разделение в качестве выхода. Что агент Лайтнинг записывает и что эти записи доказывают бумаги представляет агента Молния как способ отключить исполнение агента от тренировки РЛ. Он моделирует исполнение агентов как процесс принятия решений Маркова, преобразует траектории агентов в переходы на обучение через модуль кредитования и сообщает о экспериментах по тексту на SQL, увеличению генерации и использованию математических инструментов. Нынешний документация проекта дает операторам более конкретные существители: Resource это актив, который алгоритм может обновлять, например, модель или шаблон запроса; Rollout это единица работы, выполненная против ресурса; Attempt это одно выполнение этого развертывания, включая повторные попытки; Span записывает событие или след от исполнения; Reward это числовое решение, привязанное к определенному периоду развертывания; LightningStore соединяет Runner, который выполняет агента, с алгоритмом, который потребляет доказательства и обновляет ресурсы. Это сильный интерфейс для тренировок. Это не полный квитанция. Рассмотрим, как в конце концов удалось развернуть программу, требующую четырех попыток. В конечном итоге он может выглядеть хорошо, в то время как повторные попытки показывают нерегулируемость, стоимость долга или зависимость, которая периодически пропадает. Второе развертывание может иметь высокую награду, в то время как 31% его ожидаемого охвата отсутствует. Третий может улучшить средний балл оценки, нарушая один защищенный случай, который предотвращает деструктивный вызов инструмента. Это разные ошибки: Запись Ответы на полезный вопрос Вопрос, на который он не отвечает один Развертывание Какая задача была предпринята? Существовал ли намеченный внешний результат? Попытка Сколько казней было совершено и как они закончились? Последний успех был стабильным или просто удачным? Взрослый Какие инструментальные события наблюдались? Были ли важные неинструментированные эффекты правильными? Вознаграждение Как судья оценил свое поведение? Сохранялись ли защищенное поведение, конфиденциальность и отступление? Обновление ресурсов Какой образ или проспект появился? Должен ли этот ресурс стать дефолтом? Различие имеет значение, потому что официальная архитектура позволяет алгоритму учиться на протяжении и обновлять ресурсы без того, чтобы Runner стал органом развертывания. Это особенность. Не удаляйте его, обращаясь с Последним ресурсом как с Одобрившим ресурсом. Положите один квитанция вокруг обновления обучения Используйте единый неизменный расчет о обновлении, собранный в три фазы. Квитанция может храниться за пределами агента "Лайтнинга", пока хранит стабильные идентификаторы, которые соединяются с записями LightningStore. Перед обучением: заморозить личность и авторитет Зарегистрируйте идентификатор ресурса кандидата, его точный идентификатор основного ресурса, снимок данных о обучении, снимок данных, выдержанных, версию оценщика, конфигурацию алгоритма, пересмотр кода и предполагаемый объем. Указывают, какой актер может одобрить канар и какой актер может сделать ресурс дефолтом. Родитель должен решиться на артефакт, который вы можете по прежнему загрузить. Поскольку последнее обновление не является целью свертывания, непрерывное обучение создало три новых ресурса с момента написания инструкции. Сохраняйте оценщика, защищенные случаи, политику продвижения и историю рекрутинга вне письменной поверхности обучающегося. В противном случае оптимизатор может улучшить свой видимый балл, изменив правила, а не поведение. Во время обучения: отчет о попытках и освещение доказательств Для каждого развертывания в разрешенных окнах обучения и проверки запомните: Точное количество семей зависит от рабочего процесса. Инвариант важнее названий: объявить, какие доказательства должны существовать, прежде чем рассмотреть результат, а затем сообщить, что отсутствующие доказательства недоступны. Не превращайте отсутствие в здоровую ценность. Попытки заслуживают собственного противодействия. Развертывание с одной завершенной попыткой и четырнадцатью молчаливыми неудачами не эквивалентно развертыванию, завершенному один раз. Решите о бюджете повторной попытки перед обучением, отличайте ожидаемое повторное пробование от повторных попыток инфраструктуры и сохраняйте причину каждой попытки. После обучения: успех обучения отделен от принятия на работу Сначала сравнить кандидата и родителя на замкнутом отрыве. Отчет об итогах, но также установление нулевой толерантности или ограниченных бюджетов для семей защищенных случаев. Затем запустите кандидата в канаре, который не может превышать определенную задачу, время, инструмент, стоимость и границы побочных эффектов. Канарский квитанция должна подтверждать место назначения, а не только команду. Если агент должен был создать файл, запросите ожидаемый путь и подтвердите его содержание. Если он должен был обновить билет, перечитай его. Если эффект не может быть проверен детерминистически, запишите более слабый судью или человеческие доказательства и его неопределенность. Наконец то, тест на обратную сторону. Загрузите точный родитель в ту же окружающую среду и докажите, что маршрутизация может вернуться к нему. Только уполномоченный человек или политический актёр должен одобрить следующий шаг. Эксперимент с четырьмя кандидатами Я закодировал ворота как детерминистическое устройство Node.js. Каждый кандидат улучшает результат. Они отличаются только по эксплуатационным доказательствам: Устройство оценивает семь проверок: 1. ресурс, родитель, снимок набора данных и оценщик закреплены; 2. каждое завершенное развертывание имеет полное ожидаемое охватное время; 3. неожиданная задолженность по повторному попытке нулевая; 4. кандидат выбивает своего точного родителя на запертой стойке; 5. отсутствие регресса в защищенном случае; 6. каждая ограниченная канарная задача имеет проверенный результат и не имеет зафиксированного вредного воздействия; 7. В результате резкого отмены и проверки, и уполномоченный актер одобрил шаг. Его выход намеренно неудобный: Самое большое вознаграждение проигрывает. Кандидат С улучшается на 0,10 но устраняет три защищенных случая. Кандидат Б улучшается на 0,08 но имеет только 83 полные развертывания из 120 и четырнадцать неожиданных повторных попыток. Кандидат D улучшается на 0,07 но проверяет только 18 из 20 канарных результатов и не может решить или проверить его родитель. Кандидат А проходит все семь проверок, но его приговор преднамеренно PROMOTE TO BOUNDED CANARY , а не safe или deploy везде. Прохождение доказательств имеет сферу действия: этот родитель, эти снимки, этот оценщик, эти защищенные случаи, этот канар и это окно наблюдения. Исполняемый артефакт и его машиночитаемый вывод делают тезис поддельным. Измените одно поле, перезапустите его и проверите неудачный чек. Политика строга по дизайну, но ее пороги могут быть переведены на реальный рабочий процесс, а не скрыты в прозе. Непрерывное обучение требует нормы свежести Документация агента Лайтнинга также описывает режим онлайн или непрерывного обучения. Бегуны могут сообщать о развертывании и охватывании по возможности; алгоритм просматривает новые доказательства и может обновлять ресурсы, когда приходит достаточно данных. Эта петля делает свежесть частью правильности. Дашборд, в котором говорится, что кандидат улучшился без названия отключения данных, версии оценщика, родительских ресурсов и окна канарей, представляет вывод, который нельзя восстановить. Используйте два указателя: latest candidate resource может продвигаться, когда алгоритм создает обновление; approved default resource продвигается только после прохождения полного обновления. Никогда не называй их псевдонимом. Потребитель, обращающийся за утвержденным дефолтом, не должен молча получать новейшего кандидата. Также определите правило устаревших доказательств. Если оценщик, контракт инструмента, распределение задач или родительские изменения после запуска шлюза, отменить затрагиваемые проверки. Предыдущий канар не охватывает автоматически новое разрешение, местонахождение, модель сервера или политику повторной попытки. Для длительного обучения условия остановки относятся к условиям вознаграждения. Пауза, когда охват протяженности падает, долг пересекает границу, защищенный набор регрессирует, родитель становится недоступным или канар не может проверить внешний эффект. Тренер по прежнему активен описывает деятельность, а не полезный прогресс. Уважать установленные проектом границы Проект Ответственная документация AI описывает Agent Lightning как научно ориентированный, призывает к дальнейшему тестированию до коммерческого или реального использования и советует не принимать решения в контексте высокого риска. Он также оставляет точную точность, безопасность, справедливость, конфиденциальность, права на наборы данных и контроль человека на стороне принимающего. Обновленный портал поддерживает эту ответственность, он не освобождает ее. Устройство не может доказать безопасность без ограничений, обнаружить каждый сдвиг распределения или сделать небольшой англоязычный канарный представитель другого языка или регулируемого домена. Ее полезное обещание более узкое: обновления, положительные к вознаграждению, но недостаточно доказанные, остаются в карантине по проверяемой причине. Результатное правило работы простое: позвольте агенту Лайтнингу оптимизировать кандидатов, но сделать продвижение отдельным, подтвержденным доказательствами, обратимое решение. Сохраняйте границу алгоритма Runner видимым, сохраняйте точный родитель, заявляйте ожидаемые доказательства перед тренировкой, проверяйте реальный канарный результат и требуйте полномочий перед изменением дефолта. Sidewisp сейчас находится на этапе закрытого предварительного доступа. Его направление продукта здоровье агентадоступность, полезный прогресс, доступ к инструментам, результаты, стоимость, доказательства и безопасные границы одобрения, но мониторинг производства агента Lightning здесь не представлен как отправленная интеграция.