Harness-IF基准:12个前沿模型指令遵循被高估

arXiv 新论文提出 Harness-IF 基准,专门评测编程智能体的指令遵循能力。现有编码 Agent 虽看似遵守用户设定的规则(如 AGENTS.md),但很多时候它本来就会那么做,难以区分真正服从指令与巧合行为。评测显示 12 个前沿模型的指令遵循均被高估,聚合分数会按模型特定幅度系统性夸大其真实水平。

2026-08-14 ~ 2026-08-15 · 2 条相关