RL 训练后还说 LLM 只是「预测语言」?研究者称该说法已失效
morqon · x · 2026-09-25
Chris Hayduk 提出:既然如今大量训练算力已不再用于优化下一个词预测,继续说 LLM「靠预测语言工作」是不准确的——至少在经历大量 RL 训练之后,这种表述已无助于理解模型。
他给出的替代理解是:所谓「预测语言」,应理解为「预测能解决眼前难题的那条语言链」,而非字面上的「预测下一个 token」或「随机鹦鹉」。这一观点挑战了流行的 stochastic parrot 说法,指向 RL 后模型行为的重新定性。
「模型」频道最新
- 开发者实测:Opus 5.5 把 AI 剪辑能力拉高一代 — yihui_indie · 2026-09-25
- 用户质疑 GPT-6-Sol 暗遭降智:疑被换壳成更便宜的 Terra — monkey_spunk_ · 2026-09-25
- 同一 Prompt 对比:GPT-6 Sol 完整复刻植物大战僵尸,明显胜过 5.6 Sol — ___Patrice___ · 2026-09-25
- Opus 5.5 一次性生成 L405B 基座模型与歌词,实测演示 — Sauers_ · 2026-09-25
- AI Daily Brief 对比 Opus 5.5 与 GPT-6-Sol、Luna 最新表现 — The AI Daily Brief · 2026-09-25
- GPT-6 Astra 第 3 次尝试通关 NetHack,史上首个 LLM 通关记录 — emollick · 2026-09-25