Ben Lorica:AI 数据问题已转移至下游,瓶颈在可用性
bigdata · x · 2026-09-30
Ben Lorica 在 Gradient Flow 撰文指出,AI 的数据问题正在从「原始数据是否存在」转向「信息能否被模型安全有效地使用」。
机器人数据不再稀缺,但转化成本高:
- 有公司用超过 100 万小时人类视频训练机器人系统
- 另一家把约 1900 小时第一人称人类视频转化为 1.8 万小时以上的机器人格式训练数据
- 关键变化是:每套系统都需要大量机制把人类经验转成机器人真正可用的训练素材
Web 数据正变成有规则的交易市场:
- 一家学术出版社向 AI 研究产品开放部分书籍的检索权限,但明确保留模型训练权利
- 「用于 AI」正被拆分为训练、检索、推理等独立授权
- 网站已可区分搜索爬虫、训练爬虫与 agent 爬虫,封闭测试系统甚至支持 HTTP 402 按次收费访问
所属事件:Ben Lorica:AI 数据瓶颈从原料转向可用性(3 条相关)→
「Infra」频道最新
- 双 R9700 本地推理:PCIe Gen4 比 Gen5 损失多大? — IngwiePhoenix · 2026-09-30
- 投机解码新招 SwitchSD 入选 NeurIPS:用隐藏状态决定何时直接抄上下文 — arankomatsuzaki · 2026-09-30
- 韩国 Rebellions NPU 获 ai& 大单:单芯片 2048 TFLOPS、144GB HBM3e — DavidBennett__ · 2026-09-30
- 个人 Rust+Vulkan 训练后端两周进展:14 个架构对齐验证,PEFT 完整可用 — PhysicsDisastrous462 · 2026-09-30
- 自建模型预测美光季度营收 562 亿美元,高出官方指引 12% — tengyanAI · 2026-09-30
- DeepSeek 为华为昇腾芯片开源 TileLang,绕开 CUDA 生态 — The Decoder · 2026-09-30