从经验中学习长什么样:模型在棋局中学会重视和棋
anirudhg9119 · x · 2026-10-09
论文的具体案例展示:在国际象棋中,模型在 300 步限制下最初得 0 分,随后修改自身引擎使其在接近步数限制时重视和棋;到 checkpoint 18,它能稳住和局直到 Stockfish 出错,再完成将杀——一个从经验中习得的持久性修复。NetHack 案例见帖串主条目。
「研究」频道最新
- 自动驾驶一线经验沉淀:半监督学习“炼金术”长文 — Visual_Ability · 2026-10-09
- RLVR 被指忽视「求所有最小解」类问题:新方法找到解数量翻倍 — thoma_gu · 2026-10-09
- 有人辟谣:AI并未解决千禧年难题Navier-Stokes,Lean证明偷换概念 — gerardsans · 2026-10-09
- 新开源基准3JSBench:前沿模型能解千禧难题却建不好3D物体 — ycombinator · 2026-10-09
- Moonworks 发布 Lunara:扩散混合 Transformer 主打艺术审美,人类盲评全场最高 — paper-crow · 2026-10-09
- 实测 ChatGPT 与 Gemini 引用偏好:巴西本地域名占比达 41.4% — gaganghotra_ · 2026-10-09