研究圈共识:RL 算力与环境才是能力主引擎

burnytech 与 Sebastian Raschka 等研究者讨论指出,开放研究界正在形成一项新共识:近期的架构改动大多只是效率优化,真正驱动模型能力提升的是更好的强化学习环境、更多的 RL 算力以及更高质量的预训练数据。换言之,架构微调并非能力跃升的关键,RL 资源投入才是决定性因素。

2026-09-23 ~ 2026-09-23 · 2 条相关