COLM 2026 论文:推理微调会在 LLM 潜空间中留下持久策略状态
hunarbatra · x · 2026-10-06
一篇入选 COLM 2026 的论文《Reasoning Fine-Tuning Induces Persistent Latent Policy States》研究了微调让 LLM 学会推理时,模型内部到底发生了什么变化。作者通过追踪推理模型的内部动力学,发现推理微调会在模型的潜表示中诱导出持久性的「策略状态」,即微调不只是教模型输出推理步骤,而是实质性地重塑了其内部行为策略。作者附上了详细推文线程展开。
「研究」频道最新
- COLM 论文 SLIM:面向长程任务的智能体搜索框架 — xiye_nlp · 2026-10-06
- 光遗传学诺奖之争:被遗忘的真正发明人潘卓华 — _onionesque · 2026-10-06
- COLM 2026 现场多位博士生亮相求职,方向覆盖合成监督与人类评估 — tongshuangwu · 2026-10-06
- Kyutai 用何恺明团队 Drifting 方法训练 100M 端侧 TTS,WER 低于 1% — serrjoa · 2026-10-06
- 谷歌SHIFT按查询自动构建多智能体系统,准确率领先最强基线7.2点 — google · 2026-10-06
- 新研究诊断LLM数学短板:发现能力是最大瓶颈,可定向修复 — TexasAMUniversity · 2026-10-06