Harness-IF 基准:12 个前沿模型指令遵循均被高估
alex_verem · x · 2026-08-15
arXiv 新论文提出 Harness-IF,一个专门评测编程智能体(coding agent)指令遵循的新基准,核心发现:现有聚合分数会按模型特定的幅度系统性高估模型的「听话程度」。
要解决的问题
- 当 agent 遵守了某条规则,可能只是它本来就打算这么做。已有指令遵循基准把规则集中在用户消息里,而编程 agent 基准只看最终任务成败,都无法区分「真合规」与「碰巧一致」。
方法
- 60 道真实多轮编程任务,取自 642 条规则库,最终 256 条规则获得判定;规则部署在部署态 agent 会读取的 5 个可配置「表面」(surface,如系统提示、项目文件等)上。
- 提出 Against-Prior Accuracy(AP-Acc):只对那些与模型「无提示默认行为」相反的规则计分,通过在 9 个探测构建上抽掉规则重跑任务来观察默认行为。
结果
- 12 个前沿模型:常规准确率 72.1–85.9%,AP-Acc 仅 66.1–78.6%;所有模型在逆先验规则上都表现更差,下降 3.6–7.4 分(平均 5.81),该方向在公共支持分析与条目聚类区间下依然成立。
- 做先验控制后,榜首构建不变,但有 3 对相邻名次发生交换。
- 另一项在 9 个独立构建上的反平衡冲突试点发现:规则优先级并不遵循提示深度(系统提示、项目文件……摘要原文在此截断)。
所属事件:Harness-IF基准:12个前沿模型指令遵循被高估(2 条相关)→
「编程与Agent」频道最新
- px0 编辑器更新:git 状态流式推送,SSE 只查 3 个文件实现零轮询 — arpit_bhayani · 2026-09-20
- Google 自研面向 Agent 工作负载的开源编排器,重造有状态 Kubernetes — gaganghotra_ · 2026-09-20
- 复现 Jev 思路实测:选项乱序平均把准确率从 47% 提到 73% — WelcomeMysterious122 · 2026-09-20
- 吴恩达发布 1 小时智能体知识图谱免费课程 — irinarish · 2026-09-20
- Jev 为何可能终结文本提示词:毫秒级决策引擎重构生成式 GUI — dpopa · 2026-09-20
- 作者称 NoSpoon 智能体全自主生成内容,一条微短剧约 15 分钟完成 — Kyrannio · 2026-09-20