ExploitBench 成绩高度依赖 harness:GLM 5.3 Flash 表现远超 4.1
teortaxesTex · x · 2026-10-03
GeneralityLabs 在 Exploit Bench 上的又一项结果显示:模型成绩对 harness(运行环境)非常敏感。
- V4.1 Flash 明显弱于 5.3 Flash
- 5.3 Flash 在 Claude Code 中表现最好,Codex 居次
- 所谓「original」harness 并非 ZCode 和 DSH,而是 ExploitBench 默认的约等于一个 Python while 循环的环境
作者此前还观察到 GLM-5.3 Flash 能在 ExploitBench 上超过 Mythos Preview 的分数,并认为 TTC scaling 正在消解模型能力的「档次」划分——模型已经能持续自我改进式地进步。
「模型」频道最新
- Steve Yegge 亲测 Opus 5.5 两周:精度追平 Fable,召回略逊 — Steve_Yegge · 2026-10-03
- OpenAI Codex 全球额度重置疑跳过 Business 账号,客服建议买积分引众怒 — AdventurousFeeling19 · 2026-10-03
- Anthropic 用量 API 现神秘 iguana_necktie 字段,开发者求解 — bytebot · 2026-10-03
- 圈内人称 SSI 新模型值得期待,盛赞 Ilya 罕见表露兴奋 — iruletheworldmo · 2026-10-03
- Reddit 用户称 Opus 5.5 每周额度消耗远超预期,3 亿 token 就触顶 — Chemical-Ad-7982 · 2026-10-03
- Meta Muse 质量下滑:推理过载致任务频繁掉落且不通知 — brandon_galang · 2026-10-03