清华论文:RL 训练让 LLM 放弃探索,数百次尝试后反而输给基座模型

burny_tech · x · 2026-09-19

清华大学团队发表论文,质疑 RL 微调(DeepSeek-R1 等模型背后的方法)并未真正让 LLM 学会推理,而是重塑了其输出分布。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →