作者谈后训练:很多工作最终都收敛到一个函数和一个 reward

ivan_bezdomny · x · 2026-08-04

作者总结自己为什么喜欢做 post-training LLM:这类工作有一种高度集中的“杠杆感”。

这条帖子的核心意思是:post-training 的吸引力在于收益高、可迁移性强,但真正的瓶颈仍然是 reward 设计,而不是单纯把 RL 算法继续堆复杂。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →