RL 轨迹入损失函数,仍是下一 token 预测目标吗?
burny_tech · x · 2026-09-27
在这场 LLM 定义争论中,S00ley 认为推理、工具使用及基于此的 RL 是与 next-token 预测完全不同的范式,BERT、GPT 与 AlexNet 的共同点比与现代 LLM 更多。反驳者则指出:目标仍然是下一 token 预测,只是损失函数中用 RL 轨迹的奖励替代了与预训练分布的距离。双方分歧在于「换损失函数算不算换范式」。
「模型」频道最新
- 开源模型 Limite 1B Violetto 发布:Apache 2.0 专注数学推理 — tensorqt · 2026-09-27
- 网友展示 Opus 5.5 十五分钟完成复杂任务 — gaganghotra_ · 2026-09-27
- ROME 论文揭秘:GPT 的事实知识藏在 MLP 权重里,可精准编辑 — burny_tech · 2026-09-27
- JevBench 研究者做客 ThursdAI 播客,谈 Jev 类模型(2:01 起) — airesearch12 · 2026-09-27
- Jev 定价实测:720 状态 × 30 问题成本不到 10 美分 — schwentker · 2026-09-27
- RL 数据放进预训练会怎样?DeepMind 研究员论 LLM 本质 — burny_tech · 2026-09-27