ExploitBench 成绩高度依赖 harness:GLM 5.3 Flash 表现远超 4.1

teortaxesTex · x · 2026-10-03

GeneralityLabs 在 Exploit Bench 上的又一项结果显示:模型成绩对 harness(运行环境)非常敏感。

作者此前还观察到 GLM-5.3 Flash 能在 ExploitBench 上超过 Mythos Preview 的分数,并认为 TTC scaling 正在消解模型能力的「档次」划分——模型已经能持续自我改进式地进步。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →