纯文本 LLM 二维空间推理实测:表现取决于输出媒介与状态追踪
Ashwin Nedungadi · hf · 2026-09-03
Ashwin Nedungadi 探究纯文本大模型在开放式二维布局任务上的空间推理能力。
- 发现不同 LLM 在开放式 2D 布局生成上的表现差异很大,尽管在「几何描述→代码」这类可靠转换任务上表现稳定。
- 性能受输出媒介影响明显,而关键在于模型能否在生成过程中追踪不断演化的几何状态。
- 表现好的模型是边生成边内部维护几何状态,而非事先规划好固定方案。
「研究」频道最新
- 33.3% ImageNet 图片含多个类别,研究者称答案集本身不完整 — RexDouglass · 2026-09-03
- ImageNet 约 12% 验证集标签是错的,标注标准从未跟上需求 — RexDouglass · 2026-09-03
- 逆向思维:简化ViT实现立体3D重建SOTA,NBS模型发布 — RexDouglass · 2026-09-03
- Wasserstein 重心重构语言模型嵌入,预测同业错配惩罚更准 — uct · 2026-09-03
- Debias-SparseGPT:在剪枝稀疏化中嵌入去偏,降低大模型人口偏差 — Irina Proskurina · 2026-09-03
- 无需跨资产协方差:语言模型嵌入给出组合方差可计算上界 — uct · 2026-09-03