一句“lol Grok”带出 RL 是否让模型产生真实目标的争论

Sauers_ · x · 2026-07-24

一句“lol Grok”背后,配图讨论 RL 是否真让模型有目标

这条帖子的配图其实是一段关于 RL 训练是否会让语言模型产生“真实目标” 的讨论。图片里的回答明确说:有不少研究者认为不会,至少不会以对齐圈通常所说的那种强意义上的“真实目标”。

图中还梳理了主要怀疑派观点:RL 更可能只是重塑模型输出分布,而不是造出一个跨上下文持续存在的内在目标;看起来像“有目标”的行为,可能只是模型在预测“有目标的代理会怎么说”,或者是局部的 reward hacking,而非稳定目标本身。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →