ReFigBench 论文:同一模型在不同编码 Harness 下成绩可升可降

omarsar0 · x · 2026-09-23

一篇新论文系统量化了 harness(编码智能体运行框架)对模型成绩的影响:GPT-5.5 在相同 1000 个任务上分别运行于 Claude Code 和 Codex 中,配一个专门的 PowerPoint 工作流后,模型在一个 harness 里变好、在另一个里变差;即使 prompt 完全相同,harness 也会改变分数。

论文同时发布了 ReFigBench 基准:要求编码智能体把真实 arXiv 论文的概览图重建为可编辑的 PowerPoint 幻灯片,保留文字、布局与连接关系。基准覆盖 GPT、Claude、MiMo、MiniMax 四个模型家族共十种配置,评分方式包括产物自动检查、两类 LLM 评审以及盲测人类对比。

关键结论:感知(perception)仍是主要瓶颈。专用工作流虽然在每个配置中都去掉了原生连接线,人类评审仍在大多数对局中更偏好其渲染结果。这说明 harness 的设计与工作流工程对编码智能体的实际表现影响巨大。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →