2026-08-01T10:18:35.072Z

Agente AI que se mejora a sí mismo: promueve los cambios, no se autoedita en vivo

Congelar cada cambio de comportamiento propuesto, compararlo con su padre exacto, proteger los presupuestos de regresión, y mantener la autoridad y el retroceso fuera del bucle de escritura.

Un agente de AI que se mejora a sí mismo no debe reescribir su comportamiento en vivo y llamar el progreso de la reescritura. El defecto más seguro es tratar cada pedido propuesto, memoria, recuperación, política de herramientas o cambio de código como un candidato de liberación no confiable. Congelar al candidato, compararlo con su padre exacto en evidencia que no puede editar, comprobar cada métrica protegida, probar quién puede aprobarlo, y mantener un objetivo de retroceso resuelvable. Sólo entonces un pequeño cambio reversible puede entrar en un canario limitado. Esa regla todavía permite mejorar. Cambia la unidad de confianza. La retroalimentación puede generar un candidato automáticamente; la activación necesita evidencia. La distinción es importante porque la "auto mejora" abarca más que la formación de modelos. Reflexión almacena la retroalimentación verbal en la memoria episódica para que los ensayos posteriores se comporten de manera diferente sin una actualización de peso. Auto refinado alterna la retroalimentación y el refinamiento utilizando el mismo modelo. Un mensaje de enrutamiento, una lección recuperada, una lista de permisos de herramientas o un guión de escritura pueden alterar la próxima ejecución con la misma seguridad que un nuevo punto de control. Tu libro de cambios tiene que cubrir todas esas superficies. Congelar el candidato antes de medirlo Comience con dos identidades inmutables: el padre activo y el candidato. Un registro de manifiesto de cambio útil: La digestión impide una edición silenciosa entre la evaluación y el canario. La identidad matriz impide que un candidato generado contra agent v41 sea promovido sobre un agent v42 ahora activo. La lista de la superficie escrita revela el radio real de la explosión. Una propuesta descrita como una lección de memoria no es tan pequeña si su proceso también puede editar la política de evaluador o autoridad. No dejes que el candidato escriba sus casos de suspensión, código de puntuación, umbrales de aceptación, política de aprobación o historial de retroceso. Es la regla, la cerradura y la salida de emergencia. Un agente que puede cambiarlos puede aumentar su puntaje sin mejorar la tarea. Esta es también la razón por la que un archivo de aprendizaje solo de apéndice merece la versión. Una breve lección puede redirigir la recuperación, suprimir la escalada o la elección de herramientas de sesgo en cada ejecución posterior. Sólo la memoria modificada describe el mecanismo de almacenamiento, no el riesgo operativo. Comparar el padre exacto y el candidato en pruebas cerradas Una puntuación absoluta del candidato es una prueba débil. Ejecutar el padre y el candidato contra las mismas ID de caso, versión del entorno, fichas de herramientas, política de aleatoriedad y verificador de resultados. Guarde los resultados combinados. La pregunta no es ¿¿El candidato obtuvo un puntaje de 0,86? ¿Qué ha cambiado en relación con el padre, en qué casos y a qué costo? El Libro de cocina de agentes autodevelopes de OpenAI demuestra un bucle práctico con una línea de base, retroalimentación humana o de modelo, evaluaciones, un umbral de puntuación, un límite de reanálisis y una línea de base actualizada. Es una maquinaria útil para generar y medir candidatos. Una decisión de promoción de la producción necesita un límite más estricto que un umbral agregado, porque los promedios ocultan qué propiedad pagó por la ganancia. Supongamos que el éxito de la tarea aumenta de 0.80 a 0.89 , mientras que la integridad del efecto herramienta cae de 0.99 a 0.96 . El promedio puede subir. El cambio sigue fracasando si los efectos externos duplicados o ausentes son inaceptables. Hacer que las métricas objetivo y las métricas protegidas sean explícitas: Metría Dirección Regla de promoción El éxito de la tarea Más alto El candidato debe mejorar al menos en 0.03 Integridad del efecto herramienta Más alto No se permite la regresión Enrutamiento de aprobación Más alto La regresión no podrá exceder de 0.02 Costo por resultado verificado Más abajo El incremento no podrá exceder de 0.05 Utilice métricas vinculadas a resultados observables. Un comando que salió de cero no es prueba de que exista un entregable. Una llamada de herramienta en un rastro no es prueba de que el destino haya cambiado exactamente una vez. Un juez modelo puede ayudar con la calidad subjetiva, pero no debe anular un archivo determinista, base de datos, permiso o verificación de efectos. El conjunto bloqueado debe incluir fallas conocidas y espera válida. De lo contrario, el agente puede parecer mejorar al volverse más agresivo: menos escaladas, menos preguntas, una finalización más rápida y más efectos secundarios incorrectos. Incluir al menos una medida fuera de banda que el candidato no optimice directamente. Autoridad de propuesta separada de la autoridad de activación Permitir que un agente proponga un cambio no implica la autoridad para activarlo. Definir la aprobación por superficie y radio de explosión. Un pequeño cambio de enrutamiento rápido podría entrar en un canario de 20 tareas bajo una política preaprobada. Un cambio en la política de recuperación o en la política de herramientas puede requerir un humano nombrado. El código de tiempo de ejecución, la lógica del evaluador, el alcance de las credenciales y las acciones irreversibles deben permanecer fuera de la promoción automática. Orientación de la OWASP sobre la Agencia excesiva recomienda permisos mínimos, autorización descendente y aprobación humana para acciones de alto impacto. Aplicar la misma separación a la auto modificación. El proceso de mejora obtiene sólo la capacidad necesaria para escribir un artefacto candidato. Un componente diferente y más pequeño es el propietario de la evaluación y la promoción. Un recibo de autoridad útil incluye: El alcance del recibo para el candidato digestado en una aplicación real. Expirará. No acepte que el agente pueda mejorarse a sí mismo como un permiso ejecutable; carece de superficie, límite y límite de tiempo. Esperar la aprobación no es un fracaso. Si la evidencia pasa, pero la superficie de cambio requiere una persona, devuelva AWAITING APPROVAL con la digestión candidata, los deltas medidos, la superficie solicitada, el objetivo de retroceso y el tamaño de canario propuesto. La carrera es saludable cuando esa espera tiene un propietario y una decisión reanudable. Ejecutar las puertas en un orden fijo El orden hace que el resultado sea explicable. Rechazar los problemas estructurales antes de debatir los resultados: 1. IDENTIDAD: la digestión es válida y el padre del candidato sigue activo. 2. Superficie protegida: el candidato no puede escribir pruebas, datos de retención, autoridad, historial de retroceso u otra superficie prohibida. 3. Debidas emparejadas: el padre y el candidato utilizaron el mismo conjunto de pruebas bloqueadas. 4. Presupuesto de retroceso: cada métrica protegida se mantiene dentro de su propio límite. 5. Rollback: la versión anterior nombrada todavía se resuelve. 6. Guda material: la mejora objetivo despeja el piso pre declarado. 7. Aautoridad: el recibo coincide con el límite de superficie y canario. Las primeras cinco puertas protegen la seguridad y la auditabilidad. La ganancia material previene el ruido: un cambio que produce ruido pero que no se debe realizar ninguna mejora útil, no se debe promover simplemente porque haya superado los controles de seguridad. La autoridad decide entre la revisión con canarios y la revisión con humanos. El dispositivo de acompañamiento implementa esa prioridad sin una llamada modelo. Ejecutarlo desde el directorio de artefactos de artículos: Los ocho candidatos comparten deliberadamente una historia de éxito plausible: la mayoría eleva el puntaje objetivo. Sus decisiones difieren: El candidato Decisión de la Comisión Pruebas decisivas Parche de seguridad inmediata CANARY READY ganancias emparejadas, sin regresión protegida, autoridad automotriz limitada Cambios de recuperación AWAITING APPROVAL La evidencia pasa; la superficie requiere una persona Una pequeña lección de memoria HOLD NO MATERIAL GAIN Seguro, pero la ganancia objetivo es sólo 0.01 Padres de edad avanzada BLOCKED IDENTITY El candidato se generó a partir de la línea de base activa incorrecta Escritor de evaluación BLOCKED PROTECTED SURFACE El candidato puede cambiar el gobernante. Casos privados recientes BLOCKED EVIDENCE El candidato no usó el conjunto cerrado Ganador agregado BLOCKED REGRESSION La integridad del efecto herramienta se redujo por 0.03 Falta la vieja versión BLOCKED ROLLBACK No está disponible el artefacto de retroceso denominado El resultado útil no es una puntuación compuesta seguridad. Es un estado y un límite de reparación. Un padre obsoleto necesita regeneración. Una regresión protegida necesita un diagnóstico. Un objetivo de retroceso faltante necesita la restauración del artefacto. Mediar esos fracasos ocultaría la propiedad. Canario el cambio, no tu confianza El paso de puertas fuera de línea hace que un candidato sea elegible para un canario; no demuestra la salud de la producción. Limite las tareas, el tiempo, el gasto, las herramientas y los efectos secundarios. Mantenga al padre disponible. La ruta del canario sólo funciona cuyo resultado se puede verificar de forma independiente. Comparar sus recibos en vivo con una línea de base parental simultánea o reciente cuando la carga de trabajo lo permita. Definir los factores desencadenantes de retroceso antes de la activación: incumplimiento de la métrica protegida, tasa de resultados desconocida, efectos duplicados, falta de aprobaciones, límite de gasto o falta de evidencia de frescura. El retroceso significa restaurar el artefacto original exacto y verificar que el resultado de la tarea prevista regrese. Un comando de retroceso que se ha completado es actividad, no recuperación. Guarde tres registros después del canario: el candidato inmutable y los digestos padres; pruebas combinadas fuera de línea y canarias, incluidas las señales no disponibles; la decisión de promoción, retención, aprobación o retroceso con el recibo de su autoridad. Si la evidencia desaparece, devuelva UNCERTAIN y deja de ser promovido. No convierta una métrica ausente en un valor saludable. Si la misma propuesta falla repetidamente, el límite se retrata y se dirige a una persona en lugar de dejar que el ciclo de mejora consuma tiempo ilimitado y tokens. Sabes lo que esta puerta no puede probar La auditoría proporcionada verifica la forma manifiesta, la precedencia, los delta métricos emparejados, el alcance de la autoridad y la resolución de retroceso. No demuestra que su retención represente la producción, que una rúbrica humana es correcta, o que un raro fracaso aparecerá en 20 tareas canarias. Las pruebas pueden quedar obsoletas. Los evaluadores pueden compartir los puntos ciegos del modelo. Las herramientas externas pueden cambiar después de que el candidato pase. Por lo tanto, el impago práctico está restringido: automatizar libremente la generación de candidatos, automatizar cuidadosamente la evaluación de bajo riesgo y automatizar la activación solo dentro de un marco de autoridad explícito. Mantenga las superficies de alto impacto e irreversibles aprobadas por el hombre. Continuar con el seguimiento después de la promoción porque un agente que se mejora a sí mismo sólo es saludable cuando sus resultados útiles permanecen saludablesno cuando su línea de actualización está ocupada. Sidewisp se encuentra actualmente en versión preliminar privada. Su dirección es agregar una capa de salud alrededor de los tiempos de funcionamiento de los agentes existentes, con pruebas, límites de aprobación y verificación de resultados; generalmente no se envían adaptadores de monitoreo de producción y sistemas de recuperación. Si ese límite coincide con cómo operas a los agentes, puedes Únete a la vista previa privada.