Agent 评测分数失真?本周研究揭示路由与奖励机制隐忧
Brilliant-Tour6466 · reddit · 2026-08-19
这篇深度评论探讨了 Agent 评测中“诚实性”的问题。主要发现包括:
- 安全评分失效:Llama-3.1-8B 的实验显示,针对意图的 AUROC 达 0.803,但针对实际生成内容的 AUROC 仅 0.220,说明必须评分结果而非意图。
- 路由效率:Trie Automata 通过预计算掩码,在 K=1000 场景下比 XGrammar 快 29 倍(219 vs 7.5 RPS),但未受约束的 vLLM 更快,说明瓶颈在服务路径。
- 奖励信号沉默:在 SKALD 训练中,63% 的数据组因全对或全错导致方差为零(GRPO 无信号)。仅在这些“沉默组”上蒸馏能获得 84.7% 的全量收益,揭示奖励模型的盲区。
「编程与Agent」频道最新
- Grokbot 实测:适合小白,极客免进 — evielync · 2026-08-19
- Freebuff 发布:全平台免费 AI 编程助手,广告赞助模式 — bigaiguy · 2026-08-19
- Freebuff 推出广告赞助模式,免费提供 GPT-5.6 与 DeepSeek 编程代理 — bigaiguy · 2026-08-19
- 开发者发现 Freebuff 免费版,广告赞助即可使用类 Claude Code 代理 — thisdudelikesAI · 2026-08-19
- 开发者提出 10-80-10 法则:重两头轻中间的 AI 编程流 — _jaydeepkarale · 2026-08-19
- TrueFoundry 开源 Agent 框架 TrueForge,跑 GLM 成本直降 75% — omarsar0 · 2026-08-19