eval 管线漏洞:不支持的 tool-call 响应可被算成 100% 稳定

docybo · reddit · 2026-09-04

作者在源码层面追踪到一个 LLM benchmark 评分管线的潜在缺陷:文档声明不支持 tool-call 响应,但预处理逻辑会让它们「静默消失」——OpenAI 适配器用 message.get("content") or "",null content 的 tool-call 响应变成空字符串;Anthropic 适配器只保留 text block,丢弃 tooluse block;而评分器虽排除显式错误,却接受空字符串。

结果是这类样本在评分器眼中变成字节级相同的空输出:唯一输出、完全一致、mode share 达 1.0——测到的只是 fallback 的稳定性,而非 tool call 本身。

核心教训:预处理可能抹掉你想测量的行为。如果「不支持」被解析成看似合法的默认值,一个令人安心的分数可能掩盖了根本没测到的东西。

所属事件:LLM 稳定性基准被曝漏洞,tool-call 被吞可测假满分(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →