普林斯顿发布 QUEEN:4B 棋类语言模型达特级大师水平
普林斯顿大学陈丹琦(Danqi Chen)团队的 Adithya Bhaskar 等人发布国际象棋语言模型 QUEEN:仅约 40 亿参数,在 Lichess 达到 2697 Elo,接近特级大师(GM)中位数 2730,并能用自然语言解释自己的走法与局面评估。团队称这是针对「传统引擎棋力强但沉默、语言模型能说但棋差」痛点的一次架构与算法双重创新。
已确认
- QUEEN 由普林斯顿团队发布,作者 Adithya Bhaskar 自评其为博士期间最深刻的一篇论文
- 棋力达 Lichess 2697 Elo,接近 GM 中位数 2730;另据 Elivnurotic 转述,训练停止时棋力仍无平台期迹象
- 方法核心:不让模型从文本重新学棋,而是接上已有强力搜索引擎作为「沉默专家」,把 AlphaZero 式搜索过程反复转成自然语言解释、蒸馏回模型,即「AlphaZero 算法的自然语言类比」
- 模型能生成走法与计划的自然语言解释,可解决传统引擎「只给招不给理由」的问题
为什么重要
- 用语言模型形式复现 AlphaZero 级棋力,同时保留可解释性,弥合了「强引擎」与「会解释的 LM」之间的鸿沟
- 训练技术据作者称可推广到其他游戏、机器人操作和计算机使用等序列决策场景,具有超出下棋的应用潜力
- 4B 参数即达特级大师水平且未见棋力平台期,暗示该蒸馏范式在规模上仍有提升空间
2026-10-05 ~ 2026-10-07 · 7 条相关
一手来源
- 4B 参数国际象棋模型 Queen 达特级大师水平,还能解释走法 — Adithya Bhaskar ·
- QUEEN 论文:把 AlphaZero 式搜索翻译成语言再蒸馏给大模型下棋 — danqi_chen ·
- 普林斯顿陈丹琦团队 QUEEN 模型:4B 参数棋力 2697 还会讲棋 — 机器之心 ·
- 作者自评博士最重要论文:让语言模型用自然语言版 AlphaZero 学下棋并解释 — ChengleiSi · 2026-10-05
- 【源头】4B 参数国际象棋模型 Queen 达特级大师水平,还能解释走法 — Adithya Bhaskar · 2026-10-05
- QUEEN:4B 参数国际象棋语言模型接近特级大师并讲解走法 — danqi_chen · 2026-10-05
- 4B 参数国际象棋 LM 达特级大师水平,还能用自然语言解释每步棋 — WeijiaShi2 · 2026-10-06
- 普林斯顿把 4B 模型练到国际象棋 2700 Elo,方法可迁移到机器人 — Eliv_nurotic · 2026-10-06
- 【源头】普林斯顿陈丹琦团队 QUEEN 模型:4B 参数棋力 2697 还会讲棋 — 机器之心 · 2026-10-06
- 【源头】QUEEN 论文:把 AlphaZero 式搜索翻译成语言再蒸馏给大模型下棋 — danqi_chen · 2026-10-07