Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents
Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram
COLM 26
cs.CL
2026-08-12
微软跑 238 万次实测:同一任务换语言,前沿 agent 的动作策略只保留 71%,差距源于结构性的英语枢纽,最终答案对此完全失明。
把一个会调工具的 agent 上线成多语言版本,真正要问的是它在印地语里做的事跟英语是不是一回事:先检索还是先算、先翻译还是直接答、走三步还是八步。对 agent 来说,这条路径就是产品本身。多翻译一步的版本比英语路径多花 token 和延迟;路径不同,失败方式也不同,某个翻译步引入的错误只存在于非英语路径上,英语回归测试永远测不到。工具权限、限流、审计这些治理规则全都挂在 agent 预期的动作序列上,英语路径上验证过的策略并不描述印地语里实际发生的事。
现有多语言评测在这件事上几乎失明:标准套件只比对最终答案,agent 基准又几乎全是英语,中间的动作序列两边都丢掉了。答案一致可以掩盖任意程度的路径分歧,于是这个问题今天根本没被测量。
作者把动作策略本身做成被测对象。固定一个 ReAct 式脚手架(Thought:/Action:ToolName/Finish),给所有模型同一套五个符号工具,工具调用只解析、比对,不真正执行,研究的是模型被诱导出的工具使用策略。范围铺得很大:8 个模型、6 个基准、41 种语言、809 个语言对、238 万次 rollout、505 个单元格。每个单元格在完全相同条件下跑两遍,只换服务端随机种子。同一语言内两次的一致性记为 Iwithin,跨语言一致性记为 Icross,两者都跨种子,所以解码噪声同等进入,语言是唯一差别。归一化保留率 Ĩ = Icross / Iwithin,含义是「换语言后,一个模型自洽性的多少比例幸存」。
真正的难点在解读这些轨迹。朴素的相似度平均给出一个完全不能信的数,因为横亘着五个混淆:没有基线(同一问题用同一种语言问两遍,模型自己都答得不一样);轨迹长短有因果效应(短的天然打高分,约 6–7 分);空轨迹打满分 1.0;天花板把差距封顶在模型自身可复现性上(T=0 时 r=+0.97);机会地板让两条无关轨迹靠运气就能对上一半多(实测 c≈0.56,用置换测出来而非假设)。逐个修掉这五个之后,效应不是变小而是变大:
| 估计 | Iwithin | Icross | 校正后差距 |
| 朴素(不等长预算) | 0.663 | 0.537 | +0.0625 |
| 配齐预算、T=0.5 | 0.703 | 0.601 | +0.0861 |
| 配齐预算、T=0 | 0.837 | 0.606 | +0.2074 |
最后一行 24/24 个单元格全为正,每个自举区间都排除零。换言之,任何想用「某个混淆制造了效应」来否定它的人都失算了,因为每个混淆都在压低它。
在贪心解码(T=0)下,四个几乎毫无共同点的前沿模型收敛到几乎同一个值:换语言时各自保留 71–73% 的动作策略。这四个是 Gemma-3-27B(稠密)、Sarvam-M 24B(印地语专用稠密)、Qwen3-235B-A22B(MoE)、Llama-4-Maverick(128 专家 MoE),跨越一个数量级的规模、两种架构和完全不同的训练配比。模型身份只解释 5.7% 的方差(T=0.5 时这个数是 74.8%),模型间带宽从 T=0.5 的 13.6 分收窄到 T=0 的 2.6 分。
温度之所以关键:升温时跨语言一致性几乎不动,自洽性却急剧下降。采样噪声一直在掩盖语言效应,并未制造它,+0.0861 其实是 +0.2074 这个无采样效应的下界。代价是,直接拿未修正的绝对差距给模型排名会得到近乎相反的结论(两个温度下秩相关 ρ=−0.80),论文原话:「不该发布任何基于未修正跨语言差距的模型排名」。
规律在约 100 亿参数以下断掉,更像一个「区间」而非缩放律(只 n=2,作者自己标为假说)。小模型之间的排序基本是机会地板的假象:某个 8B 模型轨迹最短、地板最高(两条无关轨迹就打 0.669),修正后它掉出带外、一个 4B 模型反而进带内,修正直接反转了谁看着更好。两个专为多语言训练的模型(Sarvam-M 和 Aya-Expanse)在多语言 agent 行为上反而表现最差,一个输在英语优势、一个输在脚手架遵从。
为什么会这样,指向英语。Translate 是每个适配基准里被调用最多的工具,模型的推理文本即便输入是 Devanagari、泰米尔语也接近 99% 是 ASCII:agent 先翻成英语,用英语规划,再作答。这是个能做因果检验的现象。撤掉 Translate 工具,跨语言一致性按模型对它的依赖程度下降(Qwen3 有 50.5% 的调用花在 Translate 上,Sarvam 只有 18.0%)。作者预先注册了一个预测,跨四个模型成立:把 Translate 设为非英语任务的首个动作,收益随「裕量」单调增加。而被直接要求改用任务语言推理时,遵从率不到 1%(Gemma 0.79%、Sarvam 0.08%),英语枢纽不是一句 prompt 能关掉的偏好。
此外,一个正则差点造出一桩「多语言失败」。GPT-OSS-120B 有 76.4% 的轨迹解析不出、准确率不到 2%,却拿下全研究两个最高的原始一致性分,因为空对打 1.0。模型没坏,是解析器坏了:它用散文写「We will use Translate」而不吐规定语法。加两个范例,测得准确率涨 26 倍,可读输出的准确率几乎不动,干预让它变得可读,并未让它更聪明。作者建议每个头条数字旁都附上解析失败率,超过约 20% 的模型不予排名(第四家厂商 Aya-Expanse-8B 在 31.2% 同样不达标)。
对做 agent 落地的人,这篇直接戳中三件事。第一,「答案对了就放心」在多语言场景下不成立:前沿模型换语言后近三成动作策略会变,意味着成本、延迟和失败模式都跟着变,而英语回归测试覆盖不到这些路径。第二,英语枢纽是结构性的、prompt 关不掉,每条非英语请求都在交一笔 Translate 税,延迟和成本工程得把它算进去。第三,测量层面给了可执行的告诫:别用未修正的跨语言差距给模型排序,每个多语言 agent 头条数字都要报解析失败率,因为标准 ReAct 脚手架普遍用单正则抽轨迹,解析失败会伪装成多语言失败。
论文相当坦诚。规律只在前沿四个模型上成立,虽然逐单元格有 24 个、方差分解也算清楚了,n=4 终究是有界结论。71–73% 这个数字只在贪心解码下成立,引用时必须带温度。100 亿参数以下的「区间」是 n=2 的假说,不是缩放律。工具只解析、不执行,测的是被诱导出的策略,不是有真实环境反馈的执行策略,真上了线行为可能再变。第四家厂商因为 Aya-Expanse 的脚手架遵从问题留了空白。最反直觉的一条,「专为多语言训练的模型反而最差」,每个结论各自只有一两个数据点支撑,值得专门跟进。