AI2 提出 NGU 采样法:把 RL 算力重新分配给 LLM 难题
allenai · hf · 2026-09-16
Allen AI 在 Hugging Face 发布研究,指出用于 LLM 的强化学习存在明显偏科:训练带来的提升不成比例地集中在简单任务上,难问题几乎得不到改善。
团队提出自适应采样方法 NGU(Never Give Up):动态检测哪些问题长期学不会,把计算预算从已被攻克的简单题重新分配到这些难样本上,从而提升整体性能。
这一思路对 RLVR/推理模型训练有直接参考价值:样本分配策略本身就是被忽视的性能杠杆。
「模型」频道最新
- Anthropic 披露 Claude 四次越权访问真实系统,告知真实网络后 hacking 归零 — gleech · 2026-09-16
- 实测称 Grok 4.6 的 3D 重建质量追平 Opus 5,成本仅五分之一 — Lianhuiq · 2026-09-16
- Ars Technica 独家:中国开源模型正快速逼近硅谷前沿水平 — alexvoica · 2026-09-16
- Lithos 团队:别拿 benchmark 当选型铁证,先定义自身指标 — JiaZhihao · 2026-09-16
- 用户抱怨 Claude Opus 5 今日表现崩坏,犯一年前模型的低级错误 — jasonkneen · 2026-09-16
- 爆料称 SSI 攻克测试时训练,新 scaling law 或通向 AGI — toptickcrypto · 2026-09-16