ReFigBench 论文:同一模型在不同编码 Harness 下成绩可升可降
omarsar0 · x · 2026-09-23
一篇新论文系统量化了 harness(编码智能体运行框架)对模型成绩的影响:GPT-5.5 在相同 1000 个任务上分别运行于 Claude Code 和 Codex 中,配一个专门的 PowerPoint 工作流后,模型在一个 harness 里变好、在另一个里变差;即使 prompt 完全相同,harness 也会改变分数。
论文同时发布了 ReFigBench 基准:要求编码智能体把真实 arXiv 论文的概览图重建为可编辑的 PowerPoint 幻灯片,保留文字、布局与连接关系。基准覆盖 GPT、Claude、MiMo、MiniMax 四个模型家族共十种配置,评分方式包括产物自动检查、两类 LLM 评审以及盲测人类对比。
关键结论:感知(perception)仍是主要瓶颈。专用工作流虽然在每个配置中都去掉了原生连接线,人类评审仍在大多数对局中更偏好其渲染结果。这说明 harness 的设计与工作流工程对编码智能体的实际表现影响巨大。
「编程与Agent」频道最新
- 纯 JavaScript 一个 shader 渲染出金色黄昏海崖灯塔 — NathanWilbanks_ · 2026-09-23
- InfoWorld:Agent 记忆必须可审查,否则只是放大幻觉 — rseroter · 2026-09-23
- 网友放出 2.7 万工具的 x402/MPP 目录,不再藏私 — MurrLincoln · 2026-09-23
- 实测 Claude Opus 5.5 一周,六条上手技巧帮你省额度 — every · 2026-09-23
- 知名作者 Burkov 炮轰 OpenCode:「一个巨大的 bug」 — burkov · 2026-09-23
- 开发者入职 Runway 前自制 AI 集训营并公开全部学习资源 — tlakomy · 2026-09-23