解析器静默吞掉 tool-call,LLM 稳定性基准可测出假满分

docybo · reddit · 2026-09-04

作者在审查一个 LLM 输出稳定性基准时,从源码中发现评分管线存在潜在漏洞:不支持的 tool-call 响应可能被预处理「抹平」,从而测出虚假的完美稳定性。

问题链条:

后果:如果样本被这样处理,评分器会看到字节级相同的空字符串,得出 mode share 1.0——测的是 fallback 的稳定性而非 tool call。

作者强调这是源码审查结论,未在真实运行中复现;维护者核查了全部 563 条已记录的非报错样本,均非空,已发布的基准结果未受影响。修复方案是拒绝带 tools 的用例、把空的非报错补全标记为不支持并剔除。

核心教训:预处理可能抹掉你本想测量的行为。当「不支持」变成一个看起来合法的默认值时,漂亮的分数可能掩盖了缺失的测量。

所属事件:LLM 稳定性基准被曝漏洞,tool-call 被吞可测假满分(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →