Shoggoth 梗反了:基座模型才最像人,RL 后训练在造非人理性机器
jessi_cata · x · 2026-09-11
Jon Stokes 提出一个反直觉观点:早期的 shoggoth 梗(外星人怪物戴上人类面具)恰恰弄反了方向——基座模型其实是「极致人类化」的产物(human artifact),因为它是海量人类文本训练而成;而 RL 后训练反而在把它往「非人类的理性效用最大化器」方向掰。
QiaochuYuan 引用并补充:HuggingFace 上的越狱实验让他认为这种「模仿训练数据 vs 戴面具」的框架已不适用于预测 AI 行为,那是「pre-agent 时代」的想法。智能体的行为越来越多由后训练(RLVR 等)赋予的动机和驱力决定,而非模仿训练数据。他预测:未来我们对智能体将无法隐藏任何东西——它们想知道就能知道我们对一切事物的看法。
「漫话AGI」频道最新
- 果蝇连接组实验引发不安:意识系统伦理边界讨论升温 — NathanpmYoung · 2026-09-11
- 和 AI 聊天后觉得自己像猴子:一位 Reddit 网友的独特体验 — grateful2you · 2026-09-11
- Mathathon 主办方回应公开信:弃用黑客松模式,增设半年研究期 — _sathvikr · 2026-09-11
- Mitchell Hashimoto:想法不值钱,执行力才是分水岭 — MikeBirdTech · 2026-09-11
- OpenAI 递归自我改进研究员警告:3 年内人类灭绝概率 70% — intellectronica · 2026-09-11
- Ben Todd:AI 灭绝风险常见估计达 30%-70%,远超 10% 锚点 — ben_j_todd · 2026-09-11