Google 提出 RRSI:正则化约束 Agent 框架自我改进

Google Research 团队发布论文 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses)。研究指出 LLM agent 的能力很大程度由 harness(提示、控制流、工具、记忆与上下文管理)放大,而递归自我改进容易过拟合。RRSI 通过正则化约束这一过程,使改进对分布外任务仍有效,OOD 场景可提升 4.7 分,并节省约 30% 的 token 消耗。

2026-09-22 ~ 2026-09-23 · 4 条相关