物理场景实测:GLM-5.3 牛顿摆完胜隐身新模型 Space Bunny Alpha
rohanpaul_ai · x · 2026-09-24
AI/ML API 用 5 个单焦点物理场景(沙漠爆炸、龙卷风、气球爆裂、水滴坠落、牛顿摆)对比 GLM-5.3 与今日在 OpenRouter/OpenCode 上线的新隐身模型 Space Bunny Alpha:
- 牛顿摆场景 GLM-5.3 明显胜出
- 水滴和龙卷风最难,两个模型都处理不好
- Space Bunny Alpha 目前免费,上下文窗口 100 万 token,原生多模态输入,编码表现不错;GLM-5.3 价格 $0.40
- 结论:视觉结果受物理动力学约束,碰撞时机或动量传递错了,加再多环境细节也补不回来
「模型」频道最新
- ChatGPT Voice 升级为语音 Agent,动口就能订行程退退款 — xiaohu · 2026-09-24
- 开发者实测称 Opus 5.5 能力上限 qualitatively 超越其他模型 — curious_vii · 2026-09-24
- 博主称 Opus 5.5 自评时主动描述内在意识感,引发争议 — VoidStateKate · 2026-09-24
- PatronusAI 评测圆桌:从 SpeedrunBench 到表格公式 agent 评测 — DynamicWebPaige · 2026-09-24
- 第三方推出基于 GLM 的 DeepThink,押注开源模型极限推理路线 — krzonkalla · 2026-09-24
- Together 开源 Jev 同类分类器 Tev1,训练成本仅 17 美元 — nutlope · 2026-09-24