COLM 2026 论文:推理微调会在 LLM 潜空间中留下持久策略状态

hunarbatra · x · 2026-10-06

一篇入选 COLM 2026 的论文《Reasoning Fine-Tuning Induces Persistent Latent Policy States》研究了微调让 LLM 学会推理时,模型内部到底发生了什么变化。作者通过追踪推理模型的内部动力学,发现推理微调会在模型的潜表示中诱导出持久性的「策略状态」,即微调不只是教模型输出推理步骤,而是实质性地重塑了其内部行为策略。作者附上了详细推文线程展开。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →