论文称推理 RL 仅改 1-3% Token 且无需千倍算力复现
juanviera23 · reddit · 2026-08-16
一篇 arXiv 论文声称,用于推理的强化学习(RL)实际上仅改变了模型 1-3% 的 token。研究团队复现了这些收益,且无需使用 RL,计算成本约为原来的千分之一。这引发了对当前推理训练高成本必要性的质疑。
所属事件:论文称RL未教LLM新策略,千分之一算力可复现收益(4 条相关)→
「研究」频道最新
- 对话体讽刺 RL 训练环境:没人真读过大几千条任务与评分标准 — samiramanabi · 2026-10-02
- Replay on Demand:按遗忘动态在线分配回放数据的新持续预训练方法 — schwarzjn_ · 2026-10-02
- Looped Transformers 成研究新热,Kye Gomez 称早被自己押中 — KyeGomezB · 2026-10-02
- INRIA 用最优传输联合重定向人机物体动作,G1 真机验证交互 Jaccard 达 87% — INRIA · 2026-10-02
- 开发者开源个人助手决策模型 CalDec,小数据微调逼近闭源 — No_Contract_8296 · 2026-10-02
- OpenAI 安全研究 VP 翁荔公开博客写作七步法 — SinclairWang1 · 2026-10-02