Harness-IF 基准:12 个前沿模型指令遵循均被高估

alex_verem · x · 2026-08-15

arXiv 新论文提出 Harness-IF,一个专门评测编程智能体(coding agent)指令遵循的新基准,核心发现:现有聚合分数会按模型特定的幅度系统性高估模型的「听话程度」。

要解决的问题

方法

结果

所属事件:Harness-IF基准:12个前沿模型指令遵循被高估(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →