Composite-Bench 发布可验证电脑使用评测,GLM-5.2 领先 Kimi K3 32 分
davidtsong · x · 2026-07-24
- 这条引用里提到发布了新的长程电脑使用基准 Composite-Bench,特点是有 certified-optimal answers 和 verified compute,更强调评测的可验证性。
- 同时给出了模型对比结果:GLM-5.2 被称为比 Kimi K3 高 32 分,并且在测试过的闭源模型里,除了 Claude 之外都更强。
- 原帖作者的态度是“很高兴看到更多 CUA benchmarks 和 evals”,核心信息是电脑使用/智能体评测正在变得更系统。
「模型」频道最新
- Grok 和 Claude 被网友拟人成了 Elon 和 Dario — kevinnbass · 2026-07-24
- Kimi K3 深度研究评测胜出,但成本是 GLM 5.2 的 5 倍 — AravSrinivas · 2026-07-24
- 有人把 Kimi K3 和 Claude Fable5 评为前端审美前二 — vista8 · 2026-07-24
- Celeris-1 上线:扩散式推理、157ms 延迟、MMLU-Pro 76% — timshi_ai · 2026-07-24
- 两段提示词复刻谷歌3D地球,开发者实测 Kimi K3 — DuRuofei · 2026-07-24
- Kimi 演示称 1.5 小时重建了 Google Maps 3D 体验 — shakoistsLog · 2026-07-24