RL 究竟造新表征还是逼模型乱撞引发激辩

voooooogel 与 doomslide 就 RL 训练对 LLM 的影响展开技术讨论:一方直觉认为 RL 既可能把模型推到自身理解前沿之外,产生「煎饼式」的表面拼凑,也可能催生新表征;另一方坦承正在做类似 persona selection model 的 LLM 行为模型,最大缺口正是「新表征从何而来」,目前尚无明确答案。

2026-09-18 ~ 2026-09-18 · 2 条相关