Macaron V1 Venti 在 Agent 和编码基准上全面走高

teortaxesTex · x · 2026-07-22

图中展示了 Macaron V1 Venti 在一组聊天、Agent、编码和 UI 任务基准上的成绩,并与 GLM 5.2、GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro、Qwen 3.7 Max、Minimax M3 等模型做了对比。它在 PinchBench 94.0、TerminalBench 2.1 87.6、UI4ABench 87.8 等项目上表现尤其突出。

作者据此认为:中文模型整体仍然训练不足、RL 还不够,因此哪怕是相对温和的后训练,也还能把模型继续往上推;这也会削弱“只靠大规模蒸馏就够了”的判断。

图中几个关键分数

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →