固定评估器无法阻止 Agent 适应反馈的循环攻击

Asleep-Pilot-4142 · reddit · 2026-08-21

在 Agent 迭代中固定评估器虽能防止目标移动,但无法阻止 Agent 适应可见的验证反馈。AQuA 论文区分了可见验证与最终测试,后者虽被隔离,但若仅为程序隔离而非加密隔离,Agent 仍可能针对可见反馈进行过度适应,引发对反馈机制防御策略的探讨。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →