普林斯顿提出 Skill Entropy,大幅提升 LLM 跨技能推理能力
princetonu · hf · 2026-08-06
普林斯顿大学提出 Skill Entropy(技能熵) 概念,用于衡量大模型在长链推理中切换不同技能(如先推导数学再规划日程)的难度,并发布了包含 9 大领域 558 项技能的 Skill²-Bench 基准测试。
评测发现,当前前沿与开源模型普遍存在“技能切换鸿沟”,在高熵任务上准确率显著下降。为此,研究者提出 Skill-Entropy RL 强化学习框架,让模型在预测答案的同时预测所用技能,并结合步级正确性与技能序列对齐度计算奖励。实验表明,该方法在 Qwen3-4B 和 1.7B 模型上分别将基准得分提升至 68.4% 和 40.1%,且该训练信号可无缝接入现有训练数据。
「研究」频道最新
- 伯克利提出 RHI 算法:优化智能体框架,推理成本大降 60% — ceciletamura · 2026-08-06
- LLM 担当自主网络防御者:多智能体协同攻防研究 — xuanalogue · 2026-08-06
- 耗时十年覆盖两千余名患者,Nature 发布人类癌症模型数据集 — anshulkundaje · 2026-08-06
- SKILL-KD:通过对比蒸馏将技能显式迁移给较弱的大模型智能体 — ZhejiangUniversity · 2026-08-06
- 腾讯研究:视觉语言智能体存在严重的空间记忆过时风险 — tencent · 2026-08-06
- BridgeVLA++ 框架引入时空记忆,大幅提升 3D 机器人操作泛化性 — Peiyan Li · 2026-08-06