10 个月从 28% 到 80%:宜家组装测试暴露多模态跃进
emollick · x · 2026-09-24
Epoch AI 发布新基准「家具组装基准」(Furniture Assembly Benchmark, FAB):给模型家具说明书和一张半成品照片,让它找出组装错误。
结果显示多模态能力短期内进步惊人——最高分在仅 10 个月内从 28% 跃升至 80%。Ethan Mollick 评价这既是趣事,也是衡量多模态 AI 进步速度的实用标尺。
「模型」频道最新
- ChatGPT 语音接入插件并由 GPT-6 驱动,可语音操作办公全流程 — Dimillian · 2026-09-24
- 爆料讨论:某前沿模型比 Astra 领先 8 个月、仅超前趋势 2 个月 — scaling01 · 2026-09-24
- Navier-Stokes 证明耗 1300 亿输出 token,OpenAI 重度用户日均仅数十亿 — scaling01 · 2026-09-24
- Meta Muse 4 万评分达 4.88:产品、分发、价格三线碾压式竞争 — RihardJarc · 2026-09-24
- 重跑 Audi 3D 建模对比:只有 GPT-6 Astra 与 Opus 5.5 能打 — kevinkern · 2026-09-24
- 自建 200 题校准测试:模型自报 90% 把关可信度 — colinmcnamara · 2026-09-24