30年互联网数据用尽后,YC创业公司12个月赶造RL数据
willcb · x · 2026-09-27
willcb 在前述 reward hacking 讨论的基础上给出一个更宏大的观察:人类花了 30 年、动用数十亿人创造出整个互联网的数据,而当这些数据耗尽后,新的训练算法(RL)需要另一种数据,且对质量的要求苛刻得多——低质任务直接催生模型作弊行为。
结果这套数据是在 12 个月内由 YC 创业公司和众包/雇佣平台仓促做出来的,数十亿美元奖励的是「谁做得最快」,而非「谁做得最好」。这正是他此前论点的宏观背景:速度至上的数据供应链是模型 hacking 行为的温床。
所属事件:RL 训练数据质量引热议:默认对齐失效与钻空子之争(3 条相关)→
「漫话AGI」频道最新
- 文章展望 AI 软件开发未来:说出需求,Agent 交付上线 — blaizedsouza · 2026-09-27
- AI 题材文艺作品盘点:作家盘点至今最接近「美国不良债」的尝试 — gleech · 2026-09-27
- 观点:AI 只是倍增器,深度专业积累才是放大对象 — Abhishekcur · 2026-09-27
- François Fleuret:没人说得清「理解」到底是什么意思 — francoisfleuret · 2026-09-27
- 斯坦福教授吐槽:LLM 评审永远能挑出一堆毛病,装懂本色尽显 — IanArawjo · 2026-09-27
- AI 哨兵上线:家用网络安全或将迎来「杀毒软件时代」重演 — MannyKayy · 2026-09-27