回顾 LLM 进阶之路:从 RLHF 到思维链
ZeroStateReflex · x · 2026-08-22
这篇帖子总结了 LLM 近几年快速演进的关键里程碑:
- 2018-2020:初期认为模型越大越聪明。
- 2020-2022:OpenAI 领悟模型无需无限变大,而是需要海量数据(全网及书籍)。
- 2022 左右:RLHF(基于人类反馈的强化学习)出现,使基座模型能对话并被训练为助手。
- 2024 左右:引入“思维链”,相当于给模型“纸和笔”,催生推理模型,可长时间思考难题。
- 2024-2025:训练重点转向 RLVR(强化学习与验证奖励)。
「漫话AGI」频道最新
- AI 自我改进无需人类纯属无稽之谈,RSI 与 AGI 同属被炒作的伪概念 — JosephJacks_ · 2026-08-22
- 谬误:AI会编程不代表无需付费软件 — gdechichi · 2026-08-22
- AI 繁荣难掩颓势,美企早期研究投入连年下降 — Afinetheorem · 2026-08-22
- Ben Goertzel 深度评析 Gary Marcus:大科技公司的奇点豪赌 — bengoertzel · 2026-08-22
- 多智能体时代将至,专家呼吁重新设计治理机制 — soumitrashukla9 · 2026-08-22
- AI 缩短技能半衰期,职业教育从看课转向即学即用 — DavidLinthicum · 2026-08-22