AI2 提出 NGU 采样法:把 RL 算力重新分配给 LLM 难题

allenai · hf · 2026-09-16

Allen AI 在 Hugging Face 发布研究,指出用于 LLM 的强化学习存在明显偏科:训练带来的提升不成比例地集中在简单任务上,难问题几乎得不到改善。

团队提出自适应采样方法 NGU(Never Give Up):动态检测哪些问题长期学不会,把计算预算从已被攻克的简单题重新分配到这些难样本上,从而提升整体性能。

这一思路对 RLVR/推理模型训练有直接参考价值:样本分配策略本身就是被忽视的性能杠杆。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →