4B 参数国际象棋模型 Queen 达特级大师水平,还能解释走法
Adithya Bhaskar · hf · 2026-10-05
Adithya Bhaskar 团队发布 Queen,一个 4B 参数的「会解释的国际象棋语言模型」,棋力达典型特级大师水平(2697 Elo),同时能生成走法与计划的自然语言解释。
核心方法:
- 架构:将一个「沉默专家」棋类编码器与指令微调 LM 通过交叉注意力结合,编码器提供超人类棋感,LM 负责推理与解释。
- QA 课程训练:通过问答式课程让 LM 学会从编码器表示中提取棋类概念。
- 迭代蒸馏:用 Bellman 更新的自然语言类比——模型分析 top 候选走法之后的局面并整合为当前局面的解释,再蒸馏回模型。
结果:经 7 轮迭代,棋力从 1782 提升到 2697 Elo(涨超 900 分),在棋力与解题准确率上大幅超过所有前沿模型,而参数量少三个数量级;解释流畅度接近 GPT-5.6-Sol (high)。
作者指出该架构是通用配方:凡有「沉默专家编码器」的领域(游戏、机器人、computer use)都可用 LM 补上解释能力。
所属事件:4B参数国际象棋模型Queen达特级大师水平并能讲解走法(2 条相关)→
「研究」频道最新
- 斯坦福两研究:给 AI 打分的基准测试可能测错了东西 — StanfordHAI · 2026-10-06
- 工程师从博客逆向重建 Neuralink 脑机接口解码器架构 — melnykowycz · 2026-10-06
- 哈佛-MIT 论文:让 agent「提前规划」的提示词反而让决策更差 — dair_ai · 2026-10-06
- 首届人机交互会议 HAIC 2027 官宣:2027 年 6 月落地华盛顿 — jasonwuishere · 2026-10-06
- Gym-Anything 获 COLM 2026 终身智能体研讨会口头报告 — wellecks · 2026-10-06
- Elo 评分失效,作者改用迁移频率归一化给模型排名 — cloneofsimo · 2026-10-06