kalomaze 发现 GPT-5.6 稳定过测而 GLM 翻车,根因或是聊天模板服务缺陷
kalomaze · x · 2026-09-19
kalomaze 对比了「GPT-5.6 能近乎确定性通过、而各 GLM 变体均失败」的同一环境测试,发现大量方差可以由一个隐藏因素解释:模型失败暴露了 chat template 相关的潜在 serving 问题——也就是说,部分「模型能力差距」可能实为推理端的模板处理缺陷所致。
这一观察提醒做模型评测时,服务端的模板实现差异足以显著扭曲成绩。
所属事件:研究者警告:工具调用解析器与chat template缺陷成评测混杂因素(3 条相关)→
「模型」频道最新
- Codex 额度重置恢复,用户称此前几天额度全面耗尽 — CtrlAltDwayne · 2026-09-19
- 传 Anthropic Opus 5.2 纯 JS+three.js 生成 5 分钟泰坦尼克电影 — dotey · 2026-09-19
- 重启会话后模型仍记得 cranberry-42:持久记忆测试趣闻 — RileyRalmuto · 2026-09-19
- 免费模型更笨?反驳帖引论文称 SOTA 模型仍难消除幻觉 — AryHHAry · 2026-09-19
- 为什么 AI 个性同质化?安全训练与依恋恐惧是主因 — alexisgallagher · 2026-09-19
- 新模型 JEV 部分平台免费用,输入 token 低至约 $0.042/百万 — airesearch12 · 2026-09-19