长程推理卡在技能切换:新指标量化短板,Qwen3-4B 得分翻倍到 68.4%

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

cs.CL, cs.LG

2026-08-06

长程推理里切换技能(算完数学再排日程)是独立于单技能的能力短板;Skill²-Bench 用 558 个技能量化它,把 Skill Entropy 当 GRPO 奖励,Qwen3-4B 得分从 34.4% 翻到 68.4%。

这篇在解决什么

一道长程推理题常常要换好几种技能:先做一段数学推导,拿结果去排日程,再用日程去做信息抽取。作者叫它 cross-skill long-horizon task(跨技能长程任务)——多步、每步要不同技能、且依赖前面那步的输出。

现有基准大多单独测某一项技能,缺一把尺子量「模型在技能之间切换得怎么样」。有意思的是,前沿模型在单技能基准上表现很好,放到这种组合任务上却明显拉胯,哪怕每个组件技能单独拿出来它都会。这说明「会切换技能」是一项跟「领域专精」正交的能力,单技能训得再强也长不出来。最常见的失败模式是:到了后面的步骤,模型沿用上一步的技能和答法,不切到当前步骤该用的技能。

方法

作者先造一把尺子,叫 Skill Entropy(技能熵)SkE(sa, sb),衡量从技能 sa 切到 sb 有多难。它是个有方向的量,顺序不同值也不同。操作定义是一个平滑过的比值:两个技能各自单独做的平均准确率,除以把它们串成两步做的准确率。比值约等于 1 表示串起来没增加难度,越大越难切。

直接两两算有约 31 万个有序对,算不动。作者用乘法分解近似:SkE(sa, sb) 约等于离开 sa 的平均成本乘以落到 sb 的平均成本。一把固定的参考模型(Claude-opus-4.7)负责打这些分,保证尺子对所有被测模型一致。

基于这把尺子建 Skill²-Bench:558 个技能、9 个域(数学、科学、代码、逻辑、信息抽取、规划可验证;创意写作、上下文检索、指令跟随开放)。每个任务沿它的技能序列取平均熵,分成低、中、高三档。可验证域用符号判等、沙箱跑测、选择题匹配等确定性打分;开放域用 rubric 加 LLM judge(同样 Claude-opus-4.7),跟人类标注的相关在 Pearson r=0.84–0.91。

结果

测了 8 个前沿加 4 个开源模型。核心发现是「技能切换缺口」:同一个技能,放进跨技能任务里做,准确率比单独做掉 4 到 13 个百分点(前沿模型 4%–10%),而且是随任务级熵近单调下降。落差最大的是规划类技能。切错域的步骤,单步准确率(32%–57%)大概只有切对域步骤(63%–79%)的一半。一句话:在某一步挑错技能,准确率基本砍半。

模型单→跨技能掉分
Qwen3-4B−12.6
GPT-5.4-mini−10.0
Claude-opus-4.7−4.3

作者再把这把尺子反过来当训练信号,提出 Skill-Entropy RL:模型每步不仅要给答案,还得先报自己这一步用了哪个技能(强制用结构化格式提交)。奖励 r = 0.7×答案分 + 0.3×技能熵分,后者衡量模型预测的技能序列跟 gold 序列对不对齐。在 Qwen3-4B-Instruct 上,Skill²-Bench 得分从 34.4% 提到 68.4%;在 Qwen3-1.7B 上从 14.6% 提到 40.1%,都压过 GRPO、STAT 等基线。同一套管线套到现成的 OpenR1-Math 上也有效,六个数学基准全部最优。

为什么重要

这篇给领域留下一个可复用的数:Skill Entropy 把「模型 X 不擅长技能切换」从一句模糊抱怨变成可测、可校准的量,并且这同一个数还能直接当 GRPO 奖励反过来训模型,立竿见影地把小模型的跨技能得分翻倍。对做长程推理训练的人,这是个低成本、能复用的训练信号。

局限与存疑

论文没有「局限」小节(全文 grep 不到 limitation)。散落的边界:技能熵用 Claude-opus-4.7 当参考模型算的,换 Gemini-3.1-pro、GPT-5.5 重算,分区重合度在 80% 以上、定性趋势一致,但并不相同。技能库是 LLM 标注、人工复核的,粒度可比靠人保证。两两熵是乘法分解近似,不是精确值。RL 奖励要求任务自带 gold 技能序列,现成数据得先额外标注。只在小模型(不超过 7B)上做了 RL,没碰前沿尺度。开放域打分依赖 LLM judge,没换判官做稳健性检验。

术语

原文与代码

社区讨论

相关论文

全部论文解读