GLM-5.3-Flash 登 Agent Arena 总榜第 19,开源模型中第 4
arena · x · 2026-08-31
Agent Arena 通过因果追踪(causal tracing)在真实世界的长程智能体任务上衡量模型表现,「净改进」(Net Improvement)表示某模型相对于平均模型对结果的改进幅度。
榜单显示 GLM-5.3-Flash 总排名第 19,净改进 +4.6%,在开源模型中排第 4。分项来看:Confirmed Success +15.3%、Praise vs. Complaint +4.9%、Steerability +2.4%、Bash Recovery -0.7%,未发现工具幻觉问题。
所属事件:智谱 GLM-5.3-Flash 登 Agent Arena 总榜第 19(3 条相关)→
「模型」频道最新
- 优化 Qwen 3.8 Flash Next:大显存下提升预填与生成速度 — Jorlen · 2026-09-01
- LLM 本质只是预测下一个词,智能体全是外部脚手架 — sethjuarez · 2026-08-31
- 内部人士:第三方模型评测中断,因算力被回收改跑他评 — sjgadler · 2026-08-31
- 开发者弃用 Opus 5 转投 Codex,称后者更优 — sirbayes · 2026-08-31
- Dots3-Note 权重开源:旨在解决基准与现实差距 — CodeByPoonam · 2026-08-31
- Tiel-Coder-35B-A3B 登榜 HF,引入投机解码与 MTP 技术 — peculiar-ragdoll · 2026-08-31