GLM-5.3 即将接入 Arena 平台测试
arena · x · 2026-08-15
Arena 平台宣布即将接入 GLM-5.3 模型进行测试。此前 GLM-5.2 的更新在 Agent Arena 中带来了显著提升,特别是在显式人类反馈(任务成功率)和隐式反馈(表扬与投诉信号)方面。
「模型」频道最新
- Qwen3.8-27B本地评测:事实提取F1与3.6持平,解码速度降16% — KitchenAmoeba4438 · 2026-08-15
- Qwen 3.8 27B 思考痕迹过长:生成 SVG 耗费 4 万 Token — hurdurdur7 · 2026-08-15
- Qwen3.8-27B在双RTX 3060上跑出40 tok/s,实测CUDA编程能力 — anderspitman · 2026-08-15
- Gemini 3.7 Flash 登顶计算机使用竞技场,超越 Claude — cgarciae88 · 2026-08-15
- 「信息丰饶悖论」:长上下文训练超阈值反伤短任务表现 — DanielKhashabi · 2026-08-15
- 付费Gemini API频繁返回503,3.7 Flash不可用而3.1 Pro正常 — silverwoodz · 2026-08-15