LLM 稳定性基准被曝漏洞,tool-call 被吞可测假满分

有作者在审查一个 LLM 输出稳定性基准时,从源码层面发现评分管线存在潜在缺陷:文档声明不支持 tool-call 响应,但 OpenAI 适配器的预处理逻辑会让这些响应「静默消失」,被解析器抹平后不计入统计,从而可能测出虚假的 100% 稳定性。该问题链条已在社区曝光,提示此类基准结果需谨慎看待。

2026-09-04 ~ 2026-09-04 · 2 条相关