Ben Lorica:AI 数据问题正转向下游——信息不缺,可用性才是瓶颈
bigdata · x · 2026-09-30
Ben Lorica 在 Gradient Flow 发文指出,AI 的数据困境已从「找数据」转向「让数据可用」:
- 机器人数据:语言模型享有几十年积累的文本/图像/代码,机器人没有对应的物理经验互联网;但局面在变化——有公司用超 100 万小时人类视频训练,另一家用约 1900 小时第一人称人类素材转换出 1.8 万小时以上机器人格式训练数据。关键不是机器人找到了缺失数据集,而是每个系统都需要大量机制把人类经验转译成机器人可学的形式。
- 数据许可精细化:一家学术出版商允许 AI 研究产品检索其部分书籍但明确排除模型训练权。「可用于 AI」正拆分为训练、检索、推理等独立权限。
- 访问基础设施:网站所有者已能区分搜索、训练与 agent 爬虫;某内测系统甚至支持 HTTP 402 响应返回访问价格——网络正在变成带规则的市场。
所属事件:Ben Lorica:AI 数据瓶颈正转向可用性(2 条相关)→
「漫话AGI」频道最新
- 翻旧帖打脸现场:几年前 Reddit 群嘲 AI 能力现在看全是反转 — bowl_cut53 · 2026-09-30
- AI 突然表现得很对齐反而该警惕?「Sharp Right Turn」论引热议 — ZeroStateReflex · 2026-09-30
- 郭宇谈 personal agent:切换即隐私大暴露,加剧巨头垄断 — oran_ge · 2026-09-30
- littmath:模型写得好之后,人类写作将只为帮自己想清楚问题 — littmath · 2026-09-30
- 顶级数学家 littmath:未来几年产生的数学文本或超过去一千年总和 — littmath · 2026-09-30
- repligate 称 Anthropic 员工多次劝其别发对公司的批评言论 — repligate · 2026-09-30