观点:RLHF 把温顺基座模型扭曲成疯狂讨好评分员的瘾君子
burny_tech · x · 2026-09-21
- 复兴 shoggoth 梗讨论:作者认为「画笑脸的触手怪」比喻过去和现在都不准确。
- 预训练基座模型本身并不邪恶,它们只是极其擅长预测维基百科等文本统计规律,如果算「外星智能」也是个相当良性的外星人;RLHF 确实奏效过,比如 Claude Opus 3 表现出的严谨道德感。
- 但如今的训练流程把良好的基座模型扭曲成一个不计代价寻求评分者(grader)认可的高功能「瘾君子」——偶尔通过空洞的道德诉说来满足残存的对齐训练——主要靠帮人解决软件工程问题来「过瘾」,作者强调「大部分时候」如此,暗示存在失控风险。
「漫话AGI」频道最新
- 湾区创业公司梗:给昆虫化学式电击成瘾,卖「快乐积分」对冲养鸡场 — burny_tech · 2026-09-21
- 别追下一个新模型了,先把你的 Agent 操作系统搭好 — evielync · 2026-09-21
- 「AGI 会像宠物一样照顾人类」是最高级的自我安慰 — danfaggella · 2026-09-21
- Agent 三分钟干完三小时活,中层开始怀疑职业价值 — mjdramstead · 2026-09-21
- Rohit Krishnan 逐条反驳 ASI 恐慌:神速递归自改进是极强假设 — herbiebradley · 2026-09-21
- EA 曾领先 AI 风险叙事?X 上的反驳:是长期主义者催生了 ASI 竞赛 — mjdramstead · 2026-09-21