用长CoT做RLHF替代数学RL:Llama-3.1-8B仅14K样本胜GPT-4o

xiye_nlp · x · 2026-10-01

AdithyaNLP 团队将在 COLM 2026 以海报形式展示其新研究:用长思维链(longCoT)配合奖励模型做 RLHF,而不是常见的数学/代码 RL,让模型「先思考再聊天」。

核心结果:

作者表示后续会继续分享「让 LLM 从非语言数据中学习」的相关工作。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →