给大模型上 RLHF:就像重新发现人类社会学
burny_tech · x · 2026-08-12
开发者分享在进行大模型强化学习(RL)训练时的感悟:这个过程仿佛是在从第一性原理出发,重新发现人性和社会建构。
他发现,在训练循环中,给模型提供类似“你做得太棒了”的鼓励性话语,实际上对训练效果有着实质性的积极影响。
「Fun」频道最新
- KOL锐评Anthropic处境尴尬:模型被批拉胯,OpenAI与中国占尽风头 — EXM7777 · 2026-08-12
- 用Gemini Omni生成《侠盗猎车手》老奶奶,多模态视频效果惊艳 — michaelrabone · 2026-08-12
- AI 会如何应对海峡穿越奖励?网友调侃顶级模型的选择 — TheZvi · 2026-08-12
- 优必选仿生人形机器人 Una 客串时尚模特,体验化妆与试装 — rohanpaul_ai · 2026-08-12
- AI 数据中心需要伪装成维多利亚时代建筑吗? — david_stillwell · 2026-08-12
- 网友吐槽:Claude 的语气就像住在苹果广告里 — akbirthko · 2026-08-12