只用办公任务做后训练,SWE-Bench Pro 竟提升 5.7 个百分点

echen · x · 2026-09-26

Surge AI 团队发布研究:他们对 Qwen3.5-122B-A10B 用一套长时程办公 RL 环境做后训练,任务涵盖文档、表格、网络调研、规划与工具使用,完全不包含任何编码任务。

结果模型在编码上照样变强:在从未见过的 SWE-Bench Pro 上提升 5.7 个百分点,其他工具使用基准也普遍改善。训练数据不含代码库约定、解析器语义、软件专属评分器或 benchmark 反馈。

团队的解释是模型学到了更通用的能力,他们称之为「Goal-Directed Execution」:

核心结论:精心设计的数据可以教会模型通用能力,而不只是领域知识——因为无论更新表格还是改代码,agent 跑的都是同一个底层循环。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →