论文称推理 RL 仅改 1-3% Token 且无需千倍算力复现

juanviera23 · reddit · 2026-08-16

一篇 arXiv 论文声称,用于推理的强化学习(RL)实际上仅改变了模型 1-3% 的 token。研究团队复现了这些收益,且无需使用 RL,计算成本约为原来的千分之一。这引发了对当前推理训练高成本必要性的质疑。

所属事件:论文称RL未教LLM新策略,千分之一算力可复现收益(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →