DeepSWE 评测:GLM-5.3 Flash 与 Fable 5 表现
zainhas · x · 2026-08-28
分享 DeepSWE 编程评测基准的图表,展示了 GLM-5.3 Flash 和 Fable 5 模型的多轮测试表现,虽然直观感觉存疑,但具体数据见引用链接。
「模型」频道最新
- Ling-3.0-flash-Fin 发布:124B 参数解决金融长文上下文漂移 — FellMentKE · 2026-08-28
- Domingos:AI 是迄今最「漏」的抽象层,漏出来的是 LLM 的混乱 — pmddomingos · 2026-08-28
- Agent Arena 榜单:Grok-4.6 综合第 15,成功确认率升 13% — arena · 2026-08-28
- 观点:模型选择应成「无聊的基础设施」,按任务切换而非绑定 — reddebtt · 2026-08-28
- Ling-3.0-flash-Fin 发布:124B 金融增强模型,API 免费且下周开源 — niacolhealth · 2026-08-28
- LLM 置信度与准确性无关:坚定语气不等于答案正确 — ClickOk5811 · 2026-08-28