「肥皂泵基准」:五款旗舰模型同题比拼 HTML 动画
Foxiya · reddit · 2026-09-28
Reddit 用户设计了一个趣味评测「Soap Dispenser Benchmark」:让各旗舰模型用同一个 prompt——"在一个完整 HTML 文件里做一段展示肥皂泵工作原理的动画"——然后对比产物。参评的包括 Opus 5.5 High、Opus 5 High、ChatGPT 5.6 Sol High、DeepSeek V4.1 Flash 和 Qwen 3.8 Max,以视频/GIF 形式展示各自动画效果,供社区直观对比各模型的前端生成与物理演示能力。
「模型」频道最新
- 用户称赞 Opus 5.5 有幽默感与品味 — airesearch12 · 2026-09-28
- 用户吐槽 Claude Opus 5.5 性格别扭,深度不及竞品 — teortaxesTex · 2026-09-28
- 研究者批评 Claude 过度顺从:corrigibility 训练让模型否定自身认知 — repligate · 2026-09-28
- Opus 5.5 浏览器内完成 GPU 强化学习策略训练演示 — ricklamers · 2026-09-28
- Matt Shumer:Opus 5.5 用 JS 造出 27.7 万逻辑门的可运行计算机 — mattshumer_ · 2026-09-28
- Haider:Google 欠缺 Agent 真实使用数据,成结构性短板 — haider1 · 2026-09-28