论文称RL未教LLM新策略,千分之一算力可复现收益
一篇arXiv论文指出,用于推理的强化学习并未教给LLM新的推理策略,只是重新分配基础模型已有解决方案的概率,改动非常稀疏,仅涉及1-3%的token且集中在高熵决策点。研究团队无需使用RL也复现了同等收益,计算成本约为原来的千分之一,引发对RL训练效率的重新审视。
2026-08-16 ~ 2026-08-16 · 4 条相关
- 论文称推理 RL 仅改 1-3% Token 且无需千倍算力复现 — juanviera23 · 2026-08-16
- 论文揭示 RL 未教推理新策略,新法成本降千倍 — mark_k · 2026-08-16
- Rethinking RL 论文:基于熵稀疏的推理优化新视角 — mark_k · 2026-08-16
另有 1 条近重复转述:mark_k