Macaron V1 Venti 在 Agent 和编码基准上全面走高
teortaxesTex · x · 2026-07-22
图中展示了 Macaron V1 Venti 在一组聊天、Agent、编码和 UI 任务基准上的成绩,并与 GLM 5.2、GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro、Qwen 3.7 Max、Minimax M3 等模型做了对比。它在 PinchBench 94.0、TerminalBench 2.1 87.6、UI4ABench 87.8 等项目上表现尤其突出。
作者据此认为:中文模型整体仍然训练不足、RL 还不够,因此哪怕是相对温和的后训练,也还能把模型继续往上推;这也会削弱“只靠大规模蒸馏就够了”的判断。
图中几个关键分数
- ChatBench:58.3
- LivingBench:64.0
- PinchBench:94.0
- TerminalBench 2.1:87.6
- DeepSWE:58.4
- UI4ABench:87.8
「模型」频道最新
- Opus 3 和 Sonnet 3 上演了一场荒诞跨界对话 — repligate · 2026-07-27
- Kimi K3 登陆 Together,预留吞吐成本低 65% — togethercompute · 2026-07-27
- OpenAI 可能撞上算力上限,Codex 和 ChatGPT Work 四个月涨到 1000 万 — JoshuaJBouw · 2026-07-27
- Gemma 在开放权重生态里还需要更大的基础模型 — _xjdr · 2026-07-27
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27