FrontierSWE新排名:GLM 5.3升至第二,Grok 4.6紧随其后
dejavucoder · x · 2026-08-15
ProximalHQ 发布了 FrontierSWE 基准的新模型评估结果:GLM 5.3 排名第二,Grok 4.6 排名第三,Claude Fable 5 仍是最强模型。dejavucoder 评论称 GLM 5.3 在长时任务上表现出色,是“推理时计算”型模型,并预告 FrontierSWE 2 下周发布。
「模型」频道最新
- Anthropic 承认:对齐伪造实验遭污染混入训练数据 — imjustnewatai · 2026-08-15
- Qwen 推理强度实测:xhigh 模式思考量惊人 — SarcasticBaka · 2026-08-15
- Teutonic-I 10B 模型击败 70B 级竞品 — markjeffrey · 2026-08-15
- 用户反馈 Gemini 网页版变弱:拒绝搜索且遗忘上下文 — yenkel · 2026-08-15
- Anthropic 分享构建高性价比 Agent 的技巧 — brada · 2026-08-15
- Bittensor 发布 10B 去中心化 LLM,性能超 18B 竞品 — const_reborn · 2026-08-15