评测混杂因素:chat template 隐性 serving 缺陷可致模型假性不及格

kalomaze · x · 2026-09-19

kalomaze 在对比评测时发现,GPT-5.6 能近乎稳定通过某环境测试而 GLM 系列变体失败,但大量方差其实来自「模型暴露了 serving 层面 chat template 的潜在问题」,而非模型能力差距。她在后续回复中吐槽评测框架的 tool call 解析器 bug 是远超预期的混杂因素,提醒做 agent 环境评测的人必须排查 harness 层实现差异。

所属事件:研究者警告:工具调用解析器与chat template缺陷成评测混杂因素(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →