QUEEN 论文:把 AlphaZero 式搜索翻译成语言再蒸馏给大模型下棋
danqi_chen · x · 2026-10-07
PhD 研究者 AdithyaNLP 的论文 QUEEN 让 LLM 下出高水平国际象棋并能解释自己。核心思路不是让模型从文本重新学会下棋,而是接上一个已有的强力「沉默专家」(搜索引擎),再把搜索过程反复转成自然语言解释、蒸馏回模型——作者称其为 AlphaZero 算法的自然语言类比,兼有架构与算法创新。
转发的 GenAIisreal 指出这一方向比象棋本身更通用:机器人、computer use、定理证明、科学模拟等领域早就有「能力远超其表达能力」的专家系统,与其造更聪明的通用模型,不如给专家装上嘴,再教会这张嘴思考。Danqi Chen 转发推荐。
所属事件:普林斯顿发布 QUEEN:4B 棋类语言模型达特级大师水平(7 条相关)→
「研究」频道最新
- 实验表明语言模型不用可训练输入嵌入表也能学会语言 — A. Bochkov · 2026-10-07
- EmbeddingGemma 2 实测:740M 参数打通图文音视频统一向量检索 — Prompt Engineering · 2026-10-07
- DOE 与 NIH 携手 DeepMind、Meta 等,共建 AI 细胞通用预测模型 — snikolov · 2026-10-07
- 双臂移动版 UMI 打通,作者称「后脑插线赛博感十足」 — neurosp1ke · 2026-10-07
- 研究者携 Meta-Harness 与 Combee 两论文亮相 COLM 2026 并求业界职位 — Kangwook_Lee · 2026-10-07
- 研究者:重大文化洞见罕有人独立原创,LLM 类比需谨慎 — AndrewLampinen · 2026-10-07