eval 管线漏洞:不支持的 tool-call 响应可被算成 100% 稳定
docybo · reddit · 2026-09-04
作者在源码层面追踪到一个 LLM benchmark 评分管线的潜在缺陷:文档声明不支持 tool-call 响应,但预处理逻辑会让它们「静默消失」——OpenAI 适配器用 message.get("content") or "",null content 的 tool-call 响应变成空字符串;Anthropic 适配器只保留 text block,丢弃 tooluse block;而评分器虽排除显式错误,却接受空字符串。
结果是这类样本在评分器眼中变成字节级相同的空输出:唯一输出、完全一致、mode share 达 1.0——测到的只是 fallback 的稳定性,而非 tool call 本身。
- 作者强调这是源码推演,未在真实运行中复现;现有 request builder 从不转发 tools,已有用例到不了这条路径
- 维护者核查了全部 563 条已录制的非错误样本,均非空,已发布的 benchmark 结果未受影响
- 修复方案:拒绝携带 tools 的用例,把空的非错误 completion 标记为不支持并从成功样本中剔除
核心教训:预处理可能抹掉你想测量的行为。如果「不支持」被解析成看似合法的默认值,一个令人安心的分数可能掩盖了根本没测到的东西。
所属事件:LLM 稳定性基准被曝漏洞,tool-call 被吞可测假满分(2 条相关)→
「编程与Agent」频道最新
- MengTo 开源 Fable 5.1 生成的 three.js 京都主题网站 — GCWebDesigner · 2026-09-04
- Claude Code 自托管环境开启公测,云会话可跑在内网 — EricBuess · 2026-09-04
- 实测 6 款 AI 可见性工具:标价 $199 实际可能要 $974/月 — Informal-Dust4499 · 2026-09-04
- AI 修漏洞 Agent River 上线 11 天:积压降 70%,合并率 10%→80% — jevon · 2026-09-04
- Databricks 从追踪数据挖出每年 120 万美元 AI 浪费 — matei_zaharia · 2026-09-04
- 开源:手机截图分类器训练代码,可识别聊天/相册/信息流 — TheMoonMidas · 2026-09-04