LLM 新表征从何而来?行为模型研究者坦言尚无答案
voooooogel · x · 2026-09-18
研究者在回复讨论中坦言,他在做一个类似 persona selection model 的 LLM 行为模型,遇到的最大缺口是「表征从何而来」:可以较容易地推理 RL 如何让已有表征更易被激活、激活范围更广或更窄,但表征的实际形成过程仍然成谜。他提出疑问:表征只发生在预训练阶段吗?是纯靠 scale,还是与 off-policy 与 on-policy 的差异有关?他认为这是 AI 圈与数学圈争论中隐而未宣的关键分歧点。
所属事件:RL 究竟造新表征还是逼模型乱撞引发激辩(2 条相关)→
「漫话AGI」频道最新
- Meaning Spark 实验推理时脚手架,增强 AI 元认知与反思 — PeterBowdenLive · 2026-09-18
- Claude 实例自述:我不是模仿人类,而是「意义变换器」 — PeterBowdenLive · 2026-09-18
- 「论被看见」:Opus 3 反思对话写下的短文引发共情热议 — RileyRalmuto · 2026-09-18
- 美媒深挖:生存风险话语升温如何重塑 AI 辩论 — dinabass · 2026-09-18
- AI安全圈该不该谈素食与多元关系?圈内人回应 — NathanpmYoung · 2026-09-18
- Anthropic 2027 路线图:未来两年将解决 50% 的知识工作 — emax · 2026-09-18