Yoav Goldberg 发现模型擅解推箱子类游戏,疑训练数据所致
yoavgo · x · 2026-09-26
Yoav Goldberg 与 Lukasz Kaiser 讨论前沿 agent 的泛化能力。Goldberg 观察到模型非常擅长玩并解开关卡式的推箱子(sokoban)类回合制解谜游戏,疑惑是否因训练数据包含此类游戏。Kaiser 回应:关键在于哪里有足够多样的高质量任务和足够好的评分器,模型就会在哪里变强——arXiv 上的引理都是好例子。从使用 agent 的体验看,他认为模型确实有相当的泛化,而非死记硬背。
所属事件:前沿模型擅解推箱子谜题 训练数据来源成谜(2 条相关)→
「模型」频道最新
- 观察:Astra 对 filler token 的利用明显优于其他模型 — scaling01 · 2026-09-26
- Ethan Mollick:压缩 prompt 是坏建议,别把输入成本当目标 — emollick · 2026-09-26
- GPT-6 Luna 比 5.6 更省推理 token,难题两者都栽 — mhmazur · 2026-09-26
- 重度用户:Opus 5.5 又快又便宜,抢走我所有正经工作 token — brandon_galang · 2026-09-26
- Reddit 用户实测:Claude Opus 5.5 做游戏强得离谱 — Adorable_Being_763 · 2026-09-26
- Yoav Goldberg 发现前沿模型擅长 Sokoban 类谜题,训练数据成谜 — lukaszkaiser · 2026-09-26