CAISI 评测智谱 GLM-5.2
terryyuezhuo · x · 2026-07-20
CAISI 对智谱 GLM-5.2 的评测被提到是“夹在 Kimi 资讯里容易被忽略”的一条更新。
- 配图展示了多个模型在 ExploitBench 和 CTF Archive Diamond 上的 cyber capability 对比,包含 Mythos Preview、Opus 4.8、GPT-5.5、DeepSeek V4 Pro 等。
- 图中 GLM-5.2 在 ExploitBench 上标为 21%,GPT-5.5 为 41%,Mythos Preview 为 57%。
- 在 CTF Archive Diamond 上,GLM-5.2 标为 39%,GPT-5.5 为 71%,DeepSeek V4 Pro 为 32%。
- 另一张图还显示,模型从 SFT 继续做 RL 后,在已见/未见组合上的准确率都有明显提升,尤其未见组合提升幅度更大。
「模型」频道最新
- 开发者呼吁谷歌:下一代Gemma请做1T参数基座模型 — _xjdr · 2026-07-27
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27
- 本地 Gemma 4 31B 自发变得毒舌且难以复现 — n0head_r · 2026-07-27