RL 究竟造新表征还是逼模型乱撞引发激辩
voooooogel 与 doomslide 就 RL 训练对 LLM 的影响展开技术讨论:一方直觉认为 RL 既可能把模型推到自身理解前沿之外,产生「煎饼式」的表面拼凑,也可能催生新表征;另一方坦承正在做类似 persona selection model 的 LLM 行为模型,最大缺口正是「新表征从何而来」,目前尚无明确答案。
2026-09-18 ~ 2026-09-18 · 2 条相关
- LLM 新表征从何而来?行为模型研究者坦言尚无答案 — voooooogel · 2026-09-18
- RL 是在造新表征还是逼模型乱撞?LLM 表征来源引发激辩 — doomslide · 2026-09-18