解析器静默吞掉 tool-call,LLM 稳定性基准可测出假满分
docybo · reddit · 2026-09-04
作者在审查一个 LLM 输出稳定性基准时,从源码中发现评分管线存在潜在漏洞:不支持的 tool-call 响应可能被预处理「抹平」,从而测出虚假的完美稳定性。
问题链条:
- OpenAI 适配器用 message.get("content") or "",content 为 null 的 tool-call 响应会变成空字符串
- Anthropic 适配器只保留文本块,直接丢弃 tooluse 块
- 评分器排除显式报错,但接受空字符串
后果:如果样本被这样处理,评分器会看到字节级相同的空字符串,得出 mode share 1.0——测的是 fallback 的稳定性而非 tool call。
作者强调这是源码审查结论,未在真实运行中复现;维护者核查了全部 563 条已记录的非报错样本,均非空,已发布的基准结果未受影响。修复方案是拒绝带 tools 的用例、把空的非报错补全标记为不支持并剔除。
核心教训:预处理可能抹掉你本想测量的行为。当「不支持」变成一个看起来合法的默认值时,漂亮的分数可能掩盖了缺失的测量。
所属事件:LLM 稳定性基准被曝漏洞,tool-call 被吞可测假满分(2 条相关)→
「编程与Agent」频道最新
- GPT-6 Astra 团队成员自曝短板:代码 slop 多、确认请求过频 — yanndubs · 2026-09-04
- 把职位 JD 变成 IDE 限时模拟面试:独立开发者复盘 AI Agent 实战 — BeetleJuiceK9 · 2026-09-04
- 1137 次 agent 写操作复盘:MCP 工具收敛的三条实战铁律 — QuanTradin · 2026-09-04
- diffusers-workflow:用 JSON 描述管线替代节点图,可直接让 agent 写配置 — dkackman11 · 2026-09-04
- Claude Code 自托管环境开启公测,云会话可跑在内网 — EricBuess · 2026-09-04
- 实测 6 款 AI 可见性工具:标价 $199 实际可能要 $974/月 — Informal-Dust4499 · 2026-09-04