把棋引擎隐状态投影进token流,14B模型六项任务打过GPT-5

Exploring Collaboration between a language and a non-language agent

Harini S, Somesh Singh, Yaman K Singla, Rajiv Ratn Shah, David Doermann, Balaji Krishnamurthy

EMNLP 2026

cs.CL, cs.AI

2026-09-01

Adobe把Lc0隐状态投影成32个连续token塞进Qwen3。单颗14B在六项协作棋任务上打平或超过任务专家和带工具的GPT-5;同一配方改成文字接口,缺口随训练拉大到2–3倍。

这篇在解决什么

LLM 越来越多被当成编排器去调度专门子 agent。双方都是语言模型时,用自然语言交接带宽够用。棋、机器人、自动驾驶里最强的专家却不是语言模型:本事写在连续隐状态里,政策分布、价值估计、看几步之后的结构。现有做法只能把这些压成几句文字再喂给 LLM,比如「Nc2,P=0.34,+0.12」。Adobe MDSR 把这种损失叫「言语化债务」(verbalization debt)。

国际象棋是干净的试验场。引擎下得过特级大师,但不会解说、不会按对手风格备战、也不会判断一道谜题有没有意思。LLM 读过海量棋评,自己却下不好。两边单独都做不成的任务,正好用来量协作接口到底丢了多少。

方法

核心招数叫 latent state internalization:把子 agent 的连续表示直接投进 LLM 的 token 流,不再先翻成话。

子 agent 用开源引擎 Lc0-BT4(15 层 Transformer,2.4 亿参数,隐状态 1024 维),全程冻结。骨干是 Qwen3,4B/8B/14B 都训了。中间一座三层 MLP,叫 LatentBridge,把引擎倒数第二层激活映射成 k=32 个连续 token,维度对齐 LLM hidden size。k=32 是扫出来的饱和点。选倒数第二层,是因为 Stage-1 对齐损失最低,先前可解释性工作也在这一层找到价值、格子和前瞻特征。

一条推理轨迹里三种 token 交错:语言模型自己的思维链、推进局面的着法、以及按需插入的 32 个状态 token。LLM 自己决定何时调用 getpolicy;可以问当前局面,也可以先走一手再问反事实局面。引擎文字摘要两边都给,差别只在有没有那 32 个连续 token。

训练两段。第一段冻住 LLM,只用引擎自对弈的局面–着法对去对齐投影器,避免把语言能力训崩。第二段用 DAPO(带非对称裁剪的 group-relative 策略优化)把 LLM 和投影器一起训,状态 token 位置做梯度屏蔽。对照系统 LLAMIA-Verb 配方完全相同,只是接口改回纯文字。

结果

六个任务组成 LLAMIA-Bench:行为克隆(Maia 分布加三个 OOD 的 Wild 切分)、谜题难度、谜题趣味、着法注释、整局解说。单颗 LLAMIA-14B 六项全是最高分。

系统Maia着法匹配Wild难度ρ趣味ρ注释BLEU-2解说G-eval
GPT-5+Lc0文字工具45400.480.1037.50.55
LLAMIA-Verb-14B45390.450.0833.20.40
LLAMIA-14B53490.710.5245.80.75

Maia、Allie 这类任务专家吃了上千万局棋。LLAMIA 只用 2 万局,在分布内 Maia 切分上落到专家带(53 vs Maia 的 52、Allie-Policy 的 54),OOD Wild 上反超最强专家 4 个点(49 vs 45)。

趣味这项最能说明接口本身在丢信息。所有文字接口系统 Spearman ρ≤0.12,14B 隐状态接口到 0.52。4B 的 LLAMIA 已经 0.38,14B 的 Verb 还在 0.08。把 32 个槽填成棋盘编码器 ChessCLIP 而不是 Lc0 状态,趣味 ρ 掉回 0.08。打乱自己的隐 token 也会塌向 Verb。

DAPO 过程中债务还在拉大,收敛时大约 2–3 倍。LLM 从 4B 扩到 14B 两边都涨,缺口不闭合。隐状态模型还学会按任务换策略:对局跟引擎、行为克隆先问再改、解说走反事实查询;Verb 在所有任务上都塌成「跟着引擎走」(62–76%)。调用次数反而更少(14B 上 1.9 次 vs 2.9 次),单次多 32 个 token,总延迟持平或更低。

围棋换 KataGo-b18,8k 个局面就把 14B 做到 5k/5d 级人类着法匹配 48/50,文字对照落后约 10 点。12 名等级分≥1700 的棋手里,LLAMIA 对局被当成人类的比例 61%,Verb 被识破 72%。解说偏好 72.2% 站 LLAMIA,差距主要在战略洞察,不在事实对错。

为什么重要

给做 agent 编排的人一个硬结论:把非语言模型当工具、只收文字摘要,在需要完整政策分布或跨步状态的任务上会系统性丢信号。扩模型、加 RL 预算都补不回来。

能落地的前提很窄:必须拿得到专家网络的隐层,闭源模型做不到。论文的折中是让开源 LLAMIA 当桥,对外仍说人话。棋和围棋之外还没有证据。对从业者更实际的信号是:如果子 agent 的价值就在连续表示里,接口就该按多模态投影器来做,别默认 ReAct 文本。

局限与存疑

正文没有独立的局限节。能看见的边界:闭源权重吃不到这条通路;围棋只做了行为克隆;人类实验 12 人;趣味相关 0.52 离能用的排序器还远;协作策略分类和解说评分都靠 GPT-4o。Lc0 和 KataGo 都是规则清晰、有强开源网络的棋类,机器人或驾驶的隐状态能不能同样对齐,论文没做。摘要写 GPT-5.1,表格统一标 GPT-5,数字按表格。

术语

原文与代码

相关论文

全部论文解读