RL 是在造新表征还是逼模型乱撞?LLM 表征来源引发激辩

doomslide · x · 2026-09-18

voooooogel 与 doomslide 就 RL 训练对 LLM 的影响展开技术讨论。voooooogel 的直觉是:RL 一方面把模型推到其自身理解能力的前沿之外,产生「煎糊」式的挣扎与绝望;另一方面以新方式构建表征,导致模型逐渐偏离人类的心智理论(ToM)直觉。

他举例称 Claudelish 中出现的 animacy reversal/reordering 等现象相对人类直觉是「新的」(或者说漂移的),但他认为目前模型更多学到的是搜索启发式,而非深层理解。doomslide 表示自己正在做 persona selection 风格的 LLM 行为建模,认为「表征从何而来」是该框架的一大空缺,并对 LLM 生成有用新表征的能力比对方更乐观,但坦言自己也还没想清楚该站在哪边。

所属事件:RL 究竟造新表征还是逼模型乱撞引发激辩(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →