字节Seed等提出Self-Developing Agents:Agent自我进化卡在目标验证与经验保留
机器之心 · wechat · 2026-09-16
字节跳动Seed与TokenWave等机构发布 Self-Developing Agents 项目,指出当前常见的「半环RSI」依赖外部 GoldenVerifier,不算真正的递归式自我改进,并用三项基准分别研究闭环中的三个环节。
ASPIRE 研究 Agent 如何从模糊目标(如「提高数学推理能力」)中自行决定学什么、怎么验证。含6个能力目标与520道专家隐藏评测题。发现目标越模糊,Agent 越忙于解释目标和选代理指标,LoRA 使用率从24.1%升至89.8%,但30个单元中最终只有1个能力增益被保留。
S³Gym 在七个文字游戏中测试自我测试、自我判断与自我改进,发现 Agent 判断当前行动质量的能力与后续收益关联很弱;经验的保存方式(原始历史 vs 摘要记忆)无通用解,参数更新还可能在部分游戏上造成退步。
HarnessDev 让模型创建并持续修改自己的执行系统,发现开发时的正向反馈常无法迁移到隐藏任务,部分修改还会破坏原有功能而需回滚。三者共同表明瓶颈不在「能不能改」,而在目标形成、验证与改进的保留机制。
「编程与Agent」频道最新
- 开发者弃 Cursor 回归 VS Code:直言用得很爽 — Arindam_1729 · 2026-09-21
- 工程师指出:智能体系统的分层大多只是过渡性设计 — rakyll · 2026-09-21
- 不全喂 HTML:agent 改内链防幻觉的拆解方案 — cneuralnetwork · 2026-09-21
- 前 Google 工程师吐槽:AGI 不可阻挡,只要搞定 YAML 配置 — rakyll · 2026-09-21
- 一张 3090 跑 Qwen 27B 自主编码 3 周:交出可用 CUDA 内核 — skeole · 2026-09-21
- 开发者吐槽:没想到有一天会掏钱买 Meta 的编程订阅 — intellectronica · 2026-09-21