LLM 新表征从何而来?行为模型研究者坦言尚无答案

voooooogel · x · 2026-09-18

研究者在回复讨论中坦言,他在做一个类似 persona selection model 的 LLM 行为模型,遇到的最大缺口是「表征从何而来」:可以较容易地推理 RL 如何让已有表征更易被激活、激活范围更广或更窄,但表征的实际形成过程仍然成谜。他提出疑问:表征只发生在预训练阶段吗?是纯靠 scale,还是与 off-policy 与 on-policy 的差异有关?他认为这是 AI 圈与数学圈争论中隐而未宣的关键分歧点。

所属事件:RL 究竟造新表征还是逼模型乱撞引发激辩(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →