Macaron V1 Venti 在 Agent 和编码基准上全面走高
teortaxesTex · x · 2026-07-22
图中展示了 Macaron V1 Venti 在一组聊天、Agent、编码和 UI 任务基准上的成绩,并与 GLM 5.2、GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro、Qwen 3.7 Max、Minimax M3 等模型做了对比。它在 PinchBench 94.0、TerminalBench 2.1 87.6、UI4ABench 87.8 等项目上表现尤其突出。
作者据此认为:中文模型整体仍然训练不足、RL 还不够,因此哪怕是相对温和的后训练,也还能把模型继续往上推;这也会削弱“只靠大规模蒸馏就够了”的判断。
图中几个关键分数
- ChatBench:58.3
- LivingBench:64.0
- PinchBench:94.0
- TerminalBench 2.1:87.6
- DeepSWE:58.4
- UI4ABench:87.8
「模型」频道最新
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- Terminal Bench v4 榜单:GLM-5.3 以 41.9% 一骑绝尘 — Ok_Warning2146 · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11