软件在环自监督:从现有科学软件批量生成终端 agent 训练环境
Zhongzhi Li · hf · 2026-10-06
论文提出 software-in-the-loop reconstruction(SWR),一种为科学领域终端 agent 自监督扩展训练环境的框架。核心思路:
- 动机:终端 agent 正被部署到软件工程之外的科学领域,但为每个任务手工编写可执行参考行为和领域验证器成本高、难复用。
- 方法:从现有软件工作流(结构化输入到输出的可执行程序)中自动获取参考输出与验证目标——执行多组输入配置,划分公开观察与隐藏评测;agent 仅凭指令、输入 schema 和公开输入输出构造候选程序,在隐藏配置上对照工作流输出评测;分层验证器结合领域语义比较、结构有效性与反作弊检查,公开反馈支持迭代修订。
- 规模与结果:实例化 6 个领域 46 个软件家族的 500 个工作流;Qwen3.8-Max 三次尝试解决 838 个任务,产出 1,422 条已验证轨迹并过采样为 3,000 条纯重构训练样本;对 Qwen3.8-27B 做监督微调后,Terminal-Bench 2 平均成绩从 47.94% 提升到 53.56%,在四种同 token 语料对照中全部领先。
结论:现有科学软件本身就能提供可扩展、行为可验证的终端 agent 监督信号。
「编程与Agent」频道最新
- 两台桌面 DGX Spark 跑起 462GB DeepSeek 模型,专家压到 2.77bit — Teknium · 2026-10-06
- mitsuhiko:用 GitHub Actions 4 小时完成一次 Pi 版本发布 — mitsuhiko · 2026-10-06
- 用开源工具快速搭出个人 Agent:作者实测 Pi Durable 框架 — omarsar0 · 2026-10-06
- Primeagen 造桌面 QA Agent:从 15 分钟压到 2 分钟仍嫌慢 — cyrus_zei · 2026-10-06
- Mantine 9.7 发布:MCP server 文档页扩至 406 个,按节返回省 90% token — DavidWells · 2026-10-06
- Claude Projects 云端会话可直接读写本地文件夹,官方开推「local hands」 — trq212 · 2026-10-06