只用办公任务做后训练,SWE-Bench Pro 竟提升 5.7 个百分点
echen · x · 2026-09-26
Surge AI 团队发布研究:他们对 Qwen3.5-122B-A10B 用一套长时程办公 RL 环境做后训练,任务涵盖文档、表格、网络调研、规划与工具使用,完全不包含任何编码任务。
结果模型在编码上照样变强:在从未见过的 SWE-Bench Pro 上提升 5.7 个百分点,其他工具使用基准也普遍改善。训练数据不含代码库约定、解析器语义、软件专属评分器或 benchmark 反馈。
团队的解释是模型学到了更通用的能力,他们称之为「Goal-Directed Execution」:
- 把模糊目标拆成具体可执行计划
- 在压力下保持目标稳定不跑偏
- 持续比对环境认知与目标是否一致
- 确认工作真正完成
核心结论:精心设计的数据可以教会模型通用能力,而不只是领域知识——因为无论更新表格还是改代码,agent 跑的都是同一个底层循环。
「研究」频道最新
- 加拿大皇家银行揭秘 ATOM 大型交易模型,用 agentic 工作流接入 LLM — VectorInst · 2026-09-26
- Vector 研究员 Kelsey Allen 用 3DSPA 让生成视频更像物理世界 — VectorInst · 2026-09-26
- OpenAI 2026 AGI 经济会议:学者呼吁补齐经济任务评测短板 — soumitrashukla9 · 2026-09-26
- 研究:AI 编码隐性组织知识,美国或可收获近一个 GDP 的增益 — soumitrashukla9 · 2026-09-26
- DiscoverPhysics:22个偏离真实物理的世界,考住最强LLM智能体 — burny_tech · 2026-09-26
- 从随机初始化自生成全部预训练数据:Self-Play Pretraining 零数据实验 — ChengleiSi · 2026-09-26