研究者警告:工具调用解析器与chat template缺陷成评测混杂因素

开发者kalomaze发推吐槽,评测框架中的工具调用解析器bug对实验结果的干扰远比预想严重,是容易被忽视的混杂变量。他在对比测试中发现,GPT-5.6能近乎确定性通过某环境测试,而各GLM变体均告失败,大量方差实际可由一个隐藏因素解释:失败模型暴露了serving层面chat template的隐性缺陷,可能导致模型被误判为不及格。

2026-09-19 ~ 2026-09-19 · 3 条相关