研究员推测模型空间推理跃升源于 Blender 训练数据
yoavartzi · x · 2026-09-12
Yoav Artzi 在回复中讨论某个模型在空间推理上的显著表现:他与 anneyouw 的新基准 REMAP 测出了 striking 的结果(即将发布,因 NeurIPS 审稿拖延)。他推测模型表现跃升的原因是「可能给模型灌了过多 Blender 训练数据」,并指出即使 ASTRA 基准也测不到人类在其他场景下的水平。
一条对前沿模型空间推理能力来源的非正式但来自一线研究者的推测。
「模型」频道最新
- 继续预训练 vs RAG:Qwen 3.5 4B 知识内化实测对比 — funJS · 2026-09-12
- DeepSeek 应用悄悄上线 4 种语音,自研 TTS 模型或在路上 — testingcatalog · 2026-09-12
- 实测 OpenAI Astra 无缝操控浏览器,作者追问「手机操作何时解决」 — infoxiao · 2026-09-12
- Sakana Fugu Max 上线 OpenRouter:多智能体编排,1M 上下文 $2/$6 定价 — SakanaAILabs · 2026-09-12
- 用户怒斥 Astra 发布仅两三天即被降智:Twitter 全炸了 — Significant-Ad6970 · 2026-09-12
- 为什么 Sonnet 5/Opus 5 体感不如 GLM 5.3?播客热议蒸馏的价值边界 — baseten · 2026-09-12