RL 轨迹入损失函数,仍是下一 token 预测目标吗?

burny_tech · x · 2026-09-27

在这场 LLM 定义争论中,S00ley 认为推理、工具使用及基于此的 RL 是与 next-token 预测完全不同的范式,BERT、GPT 与 AlexNet 的共同点比与现代 LLM 更多。反驳者则指出:目标仍然是下一 token 预测,只是损失函数中用 RL 轨迹的奖励替代了与预训练分布的距离。双方分歧在于「换损失函数算不算换范式」。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →