Ben Lorica:AI 数据问题正转向下游——可用化加工与访问授权
bigdata · x · 2026-09-29
Ben Lorica 在 Gradient Flow 撰文指出,AI 的数据问题已经从「找原料」转移到「把信息变得可用」。
- 机器人数据:有公司用了超过 100 万小时人类视频训练;另一家把约 1900 小时第一人称人类视频转化为 1.8 万+ 小时机器人格式训练数据。关键不是机器人找到了数据集,而是每个系统都需要大量「把人类经验转成机器可用」的加工机制。
- 网络数据走向规则化:学术出版社开始向 AI 研究产品开放检索但明确保留模型训练权利——「可用于 AI」正拆分为训练、检索、推理等分离的授权。技术上,网站主人已能区分搜索爬虫、训练爬虫与 agent 爬虫;某内测系统甚至支持 HTTP 402 返回「付费访问」报价。
核心论点:数据获取正变成一个有规则、有定价的市场,谁能做「数据的可用化加工」谁就掌握了新的价值环节。
「漫话AGI」频道最新
- 学者称「AI 署名」定义模糊,学术会议分流政策一两年内将失效 — ipeirotis · 2026-09-29
- 学者断言人文学科将主导高教未来,「人工人文」研究成切入点 — begusgasper · 2026-09-29
- 教育专栏作者建议:孩子年幼时应远离 AI — benjaminjriley · 2026-09-29
- 美国调查显示公众对 AI 担忧横跨多个领域,或因近期新闻加剧 — SpencrGreenberg · 2026-09-29
- 指令微调 magic:智能或可脱离目的感与自由意志存在 — sytelus · 2026-09-29
- 媒体开始正视 AI 存续风险,下一个议题:AI 会否有意识 — cccalum · 2026-09-29