kalomaze 发现 GPT-5.6 稳定过测而 GLM 翻车,根因或是聊天模板服务缺陷

kalomaze · x · 2026-09-19

kalomaze 对比了「GPT-5.6 能近乎确定性通过、而各 GLM 变体均失败」的同一环境测试,发现大量方差可以由一个隐藏因素解释:模型失败暴露了 chat template 相关的潜在 serving 问题——也就是说,部分「模型能力差距」可能实为推理端的模板处理缺陷所致。

这一观察提醒做模型评测时,服务端的模板实现差异足以显著扭曲成绩。

所属事件:研究者警告:工具调用解析器与chat template缺陷成评测混杂因素(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →