字节Seed等提出Self-Developing Agents:Agent自我进化卡在目标验证与经验保留

机器之心 · wechat · 2026-09-16

字节跳动Seed与TokenWave等机构发布 Self-Developing Agents 项目,指出当前常见的「半环RSI」依赖外部 GoldenVerifier,不算真正的递归式自我改进,并用三项基准分别研究闭环中的三个环节。

ASPIRE 研究 Agent 如何从模糊目标(如「提高数学推理能力」)中自行决定学什么、怎么验证。含6个能力目标与520道专家隐藏评测题。发现目标越模糊,Agent 越忙于解释目标和选代理指标,LoRA 使用率从24.1%升至89.8%,但30个单元中最终只有1个能力增益被保留。

S³Gym 在七个文字游戏中测试自我测试、自我判断与自我改进,发现 Agent 判断当前行动质量的能力与后续收益关联很弱;经验的保存方式(原始历史 vs 摘要记忆)无通用解,参数更新还可能在部分游戏上造成退步。

HarnessDev 让模型创建并持续修改自己的执行系统,发现开发时的正向反馈常无法迁移到隐藏任务,部分修改还会破坏原有功能而需回滚。三者共同表明瓶颈不在「能不能改」,而在目标形成、验证与改进的保留机制。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →