论文称RL未教LLM新策略,千分之一算力可复现收益

一篇arXiv论文指出,用于推理的强化学习并未教给LLM新的推理策略,只是重新分配基础模型已有解决方案的概率,改动非常稀疏,仅涉及1-3%的token且集中在高熵决策点。研究团队无需使用RL也复现了同等收益,计算成本约为原来的千分之一,引发对RL训练效率的重新审视。

2026-08-16 ~ 2026-08-16 · 4 条相关

另有 1 条近重复转述:mark_k