实测对比:V4-Flash-Vision-Exp 代码改进优于 GLM 5.3
teortaxesTex · x · 2026-09-02
作者将同一个硬核工程问题交由 V4-Flash-Vision-Exp 和 GLM 5.3 进行改进。结果显示,GLM 遇到了订阅限制,冷却期后生成的代码甚至有更多 bug。而 V4-Flash-Vision-Exp 则对原有方案实现了帕累托改进(在至少一个指标上更好且无其他指标变差)。作者据此认为,人们可能高估了“Whale”(通常指代前沿模型或特定顶级模型)与当前其他模型之间的差距。
「模型」频道最新
- GPT 5.6 Sol 全程制作动画引发技术质疑 — chongdashu · 2026-09-02
- MiniMax-H3-Turbo 开源 LoRA 去审查版登顶 Hugging Face — Pepe104 · 2026-09-02
- 网友猜测:Fable 是循环两倍的 Opus,价格才正好翻倍 — cgarciae88 · 2026-09-02
- 实测对比:Gemini 3.8 Flash 已面向 Pro/Ultra 账号推送 — Able-Line2683 · 2026-09-02
- Fable 5.1 高度复刻马里奥 1-1 关卡,网友呼吁改考关卡设计 — max_paperclips · 2026-09-02
- 3B 模型 TwIL 在形式推理上击败 120B 开源模型 — Socially-great8275 · 2026-09-02