Epoch AI 发布家具拼装基准,模型空间推理10个月从28%升至80%
rohanpaul_ai · x · 2026-09-25
Epoch AI 发布新基准 Furniture Assembly Benchmark(FAB):给模型一份家具组装说明书和一张半成品照片,要求模型找出装错的地方——是空间推理能力的实际测试。
核心发现:
- 顶级模型成绩在 10 个月内从 28% 提升到 80%
- 空间推理曾是"模型肯定做不了"的典型安全例,如今正被快速攻破
- 帖作者调侃:构建数据集的人大概得故意把大量家具装错
所属事件:Epoch AI 家具组装基准:模型空间推理十个月大跃进(2 条相关)→
「研究」频道最新
- 一次糟糕的临床试验设计损失约 300 亿美元,AI 能否提前避免? — hardimanjames · 2026-09-25
- DARLING:在线 RL 中同时优化回复质量与多样性 — DanielKhashabi · 2026-09-25
- TTIC 成立 LEIF 实验室,用形式语言理论拆解 Transformer 表达力 — lambdaviking · 2026-09-25
- 研究者一作 4 篇论文中选 NeurIPS,含一篇 Oral — abeirami · 2026-09-25
- 免校准量化方法 TQ 开源:4-bit 量化 Qwen3.8-27B 即发即用 — textclf · 2026-09-25
- Yoav Goldberg:LLM 推理链强得反常,难以解释其如何从 RL 中涌现 — yoavgo · 2026-09-25