MacaronV1实测主打UI、Agent与2.1M长上下文
卡尔的AI沃茨 · wechat · 2026-07-24
这篇文章讲什么
这是一篇对 MacaronV1 / GLM-5.2 的长篇实测与技术拆解。作者的关注点不是榜单数字,而是它在真实工作流里的 稳定性、UI 生成能力、Agent 交互能力和超长上下文能力。
关键内容
- 作者先用短提示词测试它做 网页 UI 的能力,认为它能在约 10 分钟 内从零生成一个完成度较高、接近可直接部署的介绍页。
- 随后又测试了一个 多智能体聊天室,模型能把不同角色分工出来,让它们持续对话,并生成阶段性总结。
- 在“引力粒子实验室”这类物理交互页任务中,模型能用纯 HTML/CSS/JavaScript 做出较稳定的粒子系统、可拖动引力源、排斥模式和速度限制。
- 在经典 2048 任务里,它也能正确处理合并顺序、无效移动、分数、胜负状态、键盘和触屏操作。
- 文中还解释了几个技术点:
- MoL:冻结基座模型,只在 LoRA 空间 做后训练,让聊天、Agent、代码、UI 等任务分别保留各自的“专业脑”。
- A2UI:用于测试模型能否在对话里生成合适 UI 组件的插件。
- LongStraw:一种扩展上下文的训练方法,通过只重播“做题过程”来降低显存压力。
- 作者提到,借助 8 张 H20 可以把 27B 模型训到 2.1M token 上下文;32 张 H20 也能跑通 GLM-5.2 这类更大的 MoE 模型。
- 另外还提到 MindForge 把真实 Agent 环境原封不动搬进训练,以及一个递归自我改进闭环:模型自己出题、自己做、审计轨迹、改 harness,再用优化后的数据继续训练。
总结
这篇文章的核心结论是:MacaronV1 更像一个在 UI、Agent、长上下文工程化 上很能打的模型,而不只是一个“榜单更高”的模型;作者尤其看重它在真实任务中的稳定输出和可部署性。
「模型」频道最新
- 工程师称谷歌内部代码质量仍高于 Gemini — yunta_tsai · 2026-07-24
- Anthropic 被指正在隐藏 Fable 5 推理轨迹 — ns123abc · 2026-07-24
- MindLab 开源 Macaron-V1:基于 GLM-5.2 的持续学习模型家族 — 机器之心 · 2026-07-24
- Unlimited-OCR 再登 Hugging Face 热门榜第一 — _akhaliq · 2026-07-24
- V4 更新可能延后,K3 权重或将在同一窗口发布 — teortaxesTex · 2026-07-24
- Kimi K3 Max 在软件任务上接近 GPT 5.6,价格仅 55% — togethercompute · 2026-07-24