研究者警告:工具调用解析器与chat template缺陷成评测混杂因素
开发者kalomaze发推吐槽,评测框架中的工具调用解析器bug对实验结果的干扰远比预想严重,是容易被忽视的混杂变量。他在对比测试中发现,GPT-5.6能近乎确定性通过某环境测试,而各GLM变体均告失败,大量方差实际可由一个隐藏因素解释:失败模型暴露了serving层面chat template的隐性缺陷,可能导致模型被误判为不及格。
2026-09-19 ~ 2026-09-19 · 3 条相关
- kalomaze 吐槽:工具调用解析器 bug 是比想象中更大的评测混杂因素 — kalomaze · 2026-09-19
- 评测混杂因素:chat template 隐性 serving 缺陷可致模型假性不及格 — kalomaze · 2026-09-19
- kalomaze 发现 GPT-5.6 稳定过测而 GLM 翻车,根因或是聊天模板服务缺陷 — kalomaze · 2026-09-19