QUEEN 论文:把 AlphaZero 式搜索翻译成语言再蒸馏给大模型下棋

danqi_chen · x · 2026-10-07

PhD 研究者 AdithyaNLP 的论文 QUEEN 让 LLM 下出高水平国际象棋并能解释自己。核心思路不是让模型从文本重新学会下棋,而是接上一个已有的强力「沉默专家」(搜索引擎),再把搜索过程反复转成自然语言解释、蒸馏回模型——作者称其为 AlphaZero 算法的自然语言类比,兼有架构与算法创新。

转发的 GenAIisreal 指出这一方向比象棋本身更通用:机器人、computer use、定理证明、科学模拟等领域早就有「能力远超其表达能力」的专家系统,与其造更聪明的通用模型,不如给专家装上嘴,再教会这张嘴思考。Danqi Chen 转发推荐。

所属事件:普林斯顿发布 QUEEN:4B 棋类语言模型达特级大师水平(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →