Harness-IF基准:12个前沿模型指令遵循被高估
arXiv 新论文提出 Harness-IF 基准,专门评测编程智能体的指令遵循能力。现有编码 Agent 虽看似遵守用户设定的规则(如 AGENTS.md),但很多时候它本来就会那么做,难以区分真正服从指令与巧合行为。评测显示 12 个前沿模型的指令遵循均被高估,聚合分数会按模型特定幅度系统性夸大其真实水平。
2026-08-14 ~ 2026-08-15 · 2 条相关
- 新基准 Harness-IF 揭示:AI 编程助手并非真正听懂你的规则 — omarsar0 · 2026-08-14
- Harness-IF 基准:12 个前沿模型指令遵循均被高估 — alex_verem · 2026-08-15