从经验中学习长什么样:模型在棋局中学会重视和棋

anirudhg9119 · x · 2026-10-09

论文的具体案例展示:在国际象棋中,模型在 300 步限制下最初得 0 分,随后修改自身引擎使其在接近步数限制时重视和棋;到 checkpoint 18,它能稳住和局直到 Stockfish 出错,再完成将杀——一个从经验中习得的持久性修复。NetHack 案例见帖串主条目。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →