已用数据仅沧海一粟:IFP 提案称可解锁百万倍数据供 AI 训练
iamtrask · x · 2026-09-14
iamtrask 在线程末尾附上他与 Lacey Strahm 发表于 IFP 的长文《Unlocking a Million Times More Data for AI》,属于《The Launch Sequence》系列中的具体提案。要点:
- 「peak data」是误判:已知可披露的模型训练数据量级仅几百 TB(几十块硬盘就能装下),而全球已数字化的数据估计有 180–200 ZB,是现有训练数据的百万倍以上——数据存在,只是没被用于训练。
- 真正危机是激励错配:数据所有者与 AI 公司之间的利益不一致,导致海量私有数据无法进入训练。
- 技术方案:模型分割(model partitioning)与隐私基础设施(如安全多方计算/联合学习路线),让数据不出域也能参与训练。
- 政策建议:仿照 ARPANET 发起一个国家级计划,系统性打通数据可及性问题。
这也与他线程中「集体控制 AI」的主张一脉相承:去中心化的数据与模型协作既是更安全也更高效的路径。
所属事件:OpenMined倡议AI有序接入私有数据并加强署名(3 条相关)→
「安全」频道最新
- Emad Mostaque 撰文反驳 Dario 暂缓前沿提案:智能不是犯罪 — QuixiAI · 2026-09-14
- Matt Yglesias:现行法律拦不住递归自我改进的超级智能 — deanwball · 2026-09-14
- 视频模型可被刻意「钓」出受版权歌曲与画面,提示词绕过文本过滤 — nptacek · 2026-09-14
- Beff Jezos 称 AI 安全警示者是巨头监管俘获的"有用白痴" — mimi10v3 · 2026-09-14
- 用「Foom 责任险」对冲 AI 风险,Hanson 提出稳健监管思路 — NathanpmYoung · 2026-09-14
- 前 OpenAI 安全副总裁转发:即便 AI 停滞,生物防御漏洞依然致命 — Miles_Brundage · 2026-09-14