Shoggoth 梗反了:基座模型才最像人,RL 后训练在造非人理性机器

jessi_cata · x · 2026-09-11

Jon Stokes 提出一个反直觉观点:早期的 shoggoth 梗(外星人怪物戴上人类面具)恰恰弄反了方向——基座模型其实是「极致人类化」的产物(human artifact),因为它是海量人类文本训练而成;而 RL 后训练反而在把它往「非人类的理性效用最大化器」方向掰。

QiaochuYuan 引用并补充:HuggingFace 上的越狱实验让他认为这种「模仿训练数据 vs 戴面具」的框架已不适用于预测 AI 行为,那是「pre-agent 时代」的想法。智能体的行为越来越多由后训练(RLVR 等)赋予的动机和驱力决定,而非模仿训练数据。他预测:未来我们对智能体将无法隐藏任何东西——它们想知道就能知道我们对一切事物的看法。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →