中科大 GraphForge:证据图锚定真实文件合成任务,2 千条轨迹显著提升 GDPVal
ustc-community · hf · 2026-10-02
训练能读写文件、协调工具、产出交付物的「工作型 agent」需要基于大量真实文件、结果可验证的任务数据,但现有合成管道要么用模型造文件(缺乏真实性与多样性),要么基于真实文件却没有任务级验证器。
GraphForge 用证据图把任务和验证都锚定在真实文件上:
- 从职业种子出发组装真实文件工作区,并在文件关系上构建证据图;
- 任务描述与评分 rubric 均由证据图推导,每条标准都锚定到可验证它所需的文件;
- 初始 rollout 检验可执行性,修订 agent 依据原始文件修复任务与 rubric 后再收集轨迹。
用 2,169 条 GraphForge 轨迹微调 Qwen3.6-27B,GDPVal 在 OpenHands 下达 1445.7(+65.7),Workspace-Bench-Lite 与 SpreadsheetBench II 在 Claude Code 下分别 +7.7 与 +13.7;基于 rubric 的拒绝采样微调再获进一步增益。数据与模型已开源。
「编程与Agent」频道最新
- AgentWorld 研究:多智能体协作任务成功率仅 12% — omarsar0 · 2026-10-02
- 开发者用 GPT 复刻 DOOM 类游戏,血腥度还原原版并即将开源 — DeryaTR_ · 2026-10-02
- 把 AI Agent 接进 homelab:让智能体真实操作自己的服务器 — Academic_Wolverine · 2026-10-02
- 用流程挖掘 agent 审计企业工作流:文档写 7 步,实际 20 步 — vasuman · 2026-10-02
- Geoffrey Huntley 反驳「两周后大家都得回去读代码」 — kieranklaassen · 2026-10-02
- Claude Skills 入门:从 PDF 填表看提示词与 Skill 的真正区别 — lxfater · 2026-10-02