V4.1在LiveBench排第5,Agentic Coding登顶但被指语言偏科
teortaxesTex · x · 2026-09-11
有分析指出,V4.1 在 LiveBench 上排名第 5,仅落后于 Astra、两个 Fable 以及 Muse Spark 1.3。其优势主要来自 Agentic Coding,在该项排名第 1(Fable 5.1 低 11 分,Astra 低 20 分)。
但作者认为这一优势与「Python 至上」有关:在 TypeScript 上 V4.1 与 Fable 5.1、Muse Spark 1.3 同为 60%,疑似已饱和;在 JS 上为 81.8,而其后 4 个模型均为 77.3%。作者据此称其表现「有点水」。
所属事件:V4.1登顶LiveBench编程榜位列总榜第五(2 条相关)→
「模型」频道最新
- 传 Qwen 3.8-Flash-Next 与 V4-Flash 同级,参数小 4 倍引热议 — teortaxesTex · 2026-09-11
- 用户吐槽 Claude for Word 遇到 SmartArt 就输出乱码 — rickasaurus · 2026-09-11
- 前沿模型已学会投机解码与核优化,InferenceBench 上自出招 — maksym_andr · 2026-09-11
- 曝 Fable 5.1 登顶 InferenceBench,推理提速达 9.83 倍 — maksym_andr · 2026-09-11
- 问交规问题也被拦:Astra 护栏误报率遭用户吐槽 — Angaisb_ · 2026-09-11
- 数据科学家转 AI 工程常跳过的课:LLM 看到的是 token 不是文字 — mdancho84 · 2026-09-11