论文:EvoUndo 框架确保 LLM Agent 自我演化的可恢复性

AccomplishedLeg1508 · reddit · 2026-09-02

LLM Agent 在运行时修改自身提示词、工具、中间件等执行组件的趋势日益增加。这种自演化虽然能提升能力,但成功的突变可能会留下持久影响,导致在不同于创建时的状态下无法安全逆转。

论文介绍了 EvoUndo,这是一个用于表示、合成、诊断和独立验证模型生成的自修改在反事实状态下的可恢复性的框架。在 600 个未见过的单次自演化任务中,识别出 197 个提升能力但未通过可恢复性验证的突变。在原始恢复表示下,常规修复策略无法恢复这些自然故障。

确定性预言机分析显示,扩展恢复演算将预言机恢复率从 48/197 提升至 191/197。研究表明,可靠的 Agent 自演化需要共同设计验证、状态定位、见证语义和恢复语言的表达力,而不仅仅是依赖迭代提示。

所属事件:EvoUndo 框架应对自进化 Agent 的不可逆自我修改(5 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →