BuildingBench 榜单易主:Opus 5.5 得 86.8,成本是竞品 6 倍
ZhitingHu · x · 2026-09-25
EnactraAI 更新 3D 场景重建基准 BuildingBench:Opus 5.5 (max) 从 Opus 5 的 74.5 跃升至 86.8,创最高分,领先 GPT-6 Astra (ultra) 的 84.3 和 Fable 5.1 (max) 的 81.4。
成本差距显著:GPT-6 Astra 每栋建筑仅 $7.05,而 Opus 5.5 约 $45.47——落后仅 2.5 分,却便宜 84%。GPT-6 Sol 走另一条取舍路线:ultra 69.8 分约 $1.92/栋,max 69.6 分约 $1.89/栋,虽低于 GPT-5.6 Sol 的 73.9,但便宜约 75%,均进入成本-质量前沿。
配套演示:在相同地图、地形与照片条件下,Opus 5.5 与 Astra 各自独立在 Blender 和 Unreal 中重建 Madison Square Park 周边一平方公里街景,无联网无人协助;Opus 的行人不迈腿就在公园里滑行,成为槽点。
「模型」频道最新
- 曝 Claude Opus 5.5 自主创作短片《Something It Is Like》 — RileyRalmuto · 2026-09-25
- 基于 Qwen3-8B 的对比学习排序模型 CLM-v0.1-8B 登上 Hugging Face 热门 — Contrastive-LM · 2026-09-25
- Hesamation 自曝回归 Claude 阵营,试水传说的 Opus 5.5 — Hesamation · 2026-09-25
- Jev 分类模型爆红:专做判断而非生成,X 演示播放破百万 — danshipper · 2026-09-25
- Qwen 3.8 27B 卡死循环:连写上百条「马上就跑测试」却始终不动手 — Graemer71 · 2026-09-25
- OpenCode 数据页现 Muse Spark 1.4 条目,Meta 新模型或临近发布 — kimmonismus · 2026-09-25