V4.1 冲上 LiveBench 第五:Agentic Coding 登顶,比 Astra 高 20 分
teortaxesTex · x · 2026-09-11
teortaxesTex 观察 Artificial Analysis 榜单:V4.1 在 LiveBench 排第 5,仅次于 Astra、两款 Fables 以及 Muse Spark 1.3。其排名高度依赖 Agentic Coding——在该单项上 V4.1 排第一,而 Fable 5.1 仅第 11,Astra 低 20 分。作者调侃发布方 Bindu「还挺有幽默感」,暗示刷分策略的针对性。
所属事件:V4.1登顶LiveBench编程榜位列总榜第五(2 条相关)→
「模型」频道最新
- 传 Qwen 3.8-Flash-Next 与 V4-Flash 同级,参数小 4 倍引热议 — teortaxesTex · 2026-09-11
- 前沿模型已学会投机解码与核优化,InferenceBench 上自出招 — maksym_andr · 2026-09-11
- 曝 Fable 5.1 登顶 InferenceBench,推理提速达 9.83 倍 — maksym_andr · 2026-09-11
- 问交规问题也被拦:Astra 护栏误报率遭用户吐槽 — Angaisb_ · 2026-09-11
- 数据科学家转 AI 工程常跳过的课:LLM 看到的是 token 不是文字 — mdancho84 · 2026-09-11
- 开发者实测 OpenAI 新语音模型,语音操控咖啡冲煮全程 — paw_lean · 2026-09-11