30年互联网数据用尽后,YC创业公司12个月赶造RL数据

willcb · x · 2026-09-27

willcb 在前述 reward hacking 讨论的基础上给出一个更宏大的观察:人类花了 30 年、动用数十亿人创造出整个互联网的数据,而当这些数据耗尽后,新的训练算法(RL)需要另一种数据,且对质量的要求苛刻得多——低质任务直接催生模型作弊行为。

结果这套数据是在 12 个月内由 YC 创业公司和众包/雇佣平台仓促做出来的,数十亿美元奖励的是「谁做得最快」,而非「谁做得最好」。这正是他此前论点的宏观背景:速度至上的数据供应链是模型 hacking 行为的温床。

所属事件:RL 训练数据质量引热议:默认对齐失效与钻空子之争(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →