用长CoT做RLHF替代数学RL:Llama-3.1-8B仅14K样本胜GPT-4o
xiye_nlp · x · 2026-10-01
AdithyaNLP 团队将在 COLM 2026 以海报形式展示其新研究:用长思维链(longCoT)配合奖励模型做 RLHF,而不是常见的数学/代码 RL,让模型「先思考再聊天」。
核心结果:
- 基于 Llama-3.1-8B-Instruct,仅用 14K 训练样本;
- 在聊天与创意写作上超过 GPT-4o;
- 在 AlpacaEval2 与 WildBench 上甚至超过 Claude-3.7-Sonnet (thinking)。
作者表示后续会继续分享「让 LLM 从非语言数据中学习」的相关工作。
「模型」频道最新
- LMArena 匿名模型 Gemini 4 Argon 第一手体验 — FalconsArentReal · 2026-10-01
- Beff Jezos:RSI 让 Gemini 4 像钟表一样每周自动变强 — beffjezos · 2026-10-01
- 网传 Gemini 4 Argon 将对标 GPT-6 Astra,未经证实 — sven_ai · 2026-10-01
- Reddit 用户实测称 Gemini 4 Argon 是「刷榜特化」模型 — PrisonOfH0pe · 2026-10-01
- Gemini 回复中 HTML 标签被渲染而非显示源码,用户求助 — GiangPiano · 2026-10-01
- 博主实测 Muse:友好听话但很笨,瞬间忘记格式要求 — ivan_bezdomny · 2026-10-01