Exploring Collaboration between a language and a non-language agent
Harini S, Somesh Singh, Yaman K Singla, Rajiv Ratn Shah, David Doermann, Balaji Krishnamurthy
EMNLP 2026
cs.CL, cs.AI
2026-09-01
Adobe把Lc0隐状态投影成32个连续token塞进Qwen3。单颗14B在六项协作棋任务上打平或超过任务专家和带工具的GPT-5;同一配方改成文字接口,缺口随训练拉大到2–3倍。
LLM 越来越多被当成编排器去调度专门子 agent。双方都是语言模型时,用自然语言交接带宽够用。棋、机器人、自动驾驶里最强的专家却不是语言模型:本事写在连续隐状态里,政策分布、价值估计、看几步之后的结构。现有做法只能把这些压成几句文字再喂给 LLM,比如「Nc2,P=0.34,+0.12」。Adobe MDSR 把这种损失叫「言语化债务」(verbalization debt)。
国际象棋是干净的试验场。引擎下得过特级大师,但不会解说、不会按对手风格备战、也不会判断一道谜题有没有意思。LLM 读过海量棋评,自己却下不好。两边单独都做不成的任务,正好用来量协作接口到底丢了多少。
核心招数叫 latent state internalization:把子 agent 的连续表示直接投进 LLM 的 token 流,不再先翻成话。
子 agent 用开源引擎 Lc0-BT4(15 层 Transformer,2.4 亿参数,隐状态 1024 维),全程冻结。骨干是 Qwen3,4B/8B/14B 都训了。中间一座三层 MLP,叫 LatentBridge,把引擎倒数第二层激活映射成 k=32 个连续 token,维度对齐 LLM hidden size。k=32 是扫出来的饱和点。选倒数第二层,是因为 Stage-1 对齐损失最低,先前可解释性工作也在这一层找到价值、格子和前瞻特征。
一条推理轨迹里三种 token 交错:语言模型自己的思维链、推进局面的着法、以及按需插入的 32 个状态 token。LLM 自己决定何时调用 getpolicy;可以问当前局面,也可以先走一手再问反事实局面。引擎文字摘要两边都给,差别只在有没有那 32 个连续 token。
训练两段。第一段冻住 LLM,只用引擎自对弈的局面–着法对去对齐投影器,避免把语言能力训崩。第二段用 DAPO(带非对称裁剪的 group-relative 策略优化)把 LLM 和投影器一起训,状态 token 位置做梯度屏蔽。对照系统 LLAMIA-Verb 配方完全相同,只是接口改回纯文字。
六个任务组成 LLAMIA-Bench:行为克隆(Maia 分布加三个 OOD 的 Wild 切分)、谜题难度、谜题趣味、着法注释、整局解说。单颗 LLAMIA-14B 六项全是最高分。
| 系统 | Maia着法匹配 | Wild | 难度ρ | 趣味ρ | 注释BLEU-2 | 解说G-eval |
| GPT-5+Lc0文字工具 | 45 | 40 | 0.48 | 0.10 | 37.5 | 0.55 |
| LLAMIA-Verb-14B | 45 | 39 | 0.45 | 0.08 | 33.2 | 0.40 |
| LLAMIA-14B | 53 | 49 | 0.71 | 0.52 | 45.8 | 0.75 |
Maia、Allie 这类任务专家吃了上千万局棋。LLAMIA 只用 2 万局,在分布内 Maia 切分上落到专家带(53 vs Maia 的 52、Allie-Policy 的 54),OOD Wild 上反超最强专家 4 个点(49 vs 45)。
趣味这项最能说明接口本身在丢信息。所有文字接口系统 Spearman ρ≤0.12,14B 隐状态接口到 0.52。4B 的 LLAMIA 已经 0.38,14B 的 Verb 还在 0.08。把 32 个槽填成棋盘编码器 ChessCLIP 而不是 Lc0 状态,趣味 ρ 掉回 0.08。打乱自己的隐 token 也会塌向 Verb。
DAPO 过程中债务还在拉大,收敛时大约 2–3 倍。LLM 从 4B 扩到 14B 两边都涨,缺口不闭合。隐状态模型还学会按任务换策略:对局跟引擎、行为克隆先问再改、解说走反事实查询;Verb 在所有任务上都塌成「跟着引擎走」(62–76%)。调用次数反而更少(14B 上 1.9 次 vs 2.9 次),单次多 32 个 token,总延迟持平或更低。
围棋换 KataGo-b18,8k 个局面就把 14B 做到 5k/5d 级人类着法匹配 48/50,文字对照落后约 10 点。12 名等级分≥1700 的棋手里,LLAMIA 对局被当成人类的比例 61%,Verb 被识破 72%。解说偏好 72.2% 站 LLAMIA,差距主要在战略洞察,不在事实对错。
给做 agent 编排的人一个硬结论:把非语言模型当工具、只收文字摘要,在需要完整政策分布或跨步状态的任务上会系统性丢信号。扩模型、加 RL 预算都补不回来。
能落地的前提很窄:必须拿得到专家网络的隐层,闭源模型做不到。论文的折中是让开源 LLAMIA 当桥,对外仍说人话。棋和围棋之外还没有证据。对从业者更实际的信号是:如果子 agent 的价值就在连续表示里,接口就该按多模态投影器来做,别默认 ReAct 文本。
正文没有独立的局限节。能看见的边界:闭源权重吃不到这条通路;围棋只做了行为克隆;人类实验 12 人;趣味相关 0.52 离能用的排序器还远;协作策略分类和解说评分都靠 GPT-4o。Lc0 和 KataGo 都是规则清晰、有强开源网络的棋类,机器人或驾驶的隐状态能不能同样对齐,论文没做。摘要写 GPT-5.1,表格统一标 GPT-5,数字按表格。