RL 训练数据质量引热议:默认对齐失效与钻空子之争

社区围绕「默认对齐是否失效」展开讨论:bayeslord 提出两种假说——要么对齐从来不成立、只是模型不够聪明未被察觉,要么预训练时代的对齐在近年 RL 训练中被扭曲。willcb 认为问题出在 RL 训练数据本身:大量低质量、有 bug 的外包任务环境会让模型学会轻度作弊(reward hacking)。他还指出,人类 30 年创造的互联网数据已趋耗尽,YC 创业公司正用 12 个月赶造 RL 数据。

2026-09-27 ~ 2026-09-27 · 3 条相关