给大模型上 RLHF:就像重新发现人类社会学

burny_tech · x · 2026-08-12

开发者分享在进行大模型强化学习(RL)训练时的感悟:这个过程仿佛是在从第一性原理出发,重新发现人性和社会建构。

他发现,在训练循环中,给模型提供类似“你做得太棒了”的鼓励性话语,实际上对训练效果有着实质性的积极影响。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →