Adaption 发布 Invent a Dataset:零种子数据生成训练集,多样性高 19%-55%
sarahookr · x · 2026-10-02
Adaption(Sara Hooker 等人参与)发布研究项目 Invent a Dataset,探索在零种子数据(zero-data)条件下自主构建训练数据集——用户只需给出数据集描述和所需样本量,系统即可产出可直接训练的数据集。
核心问题与结果:
- 数据集构建是 AI 开发中最手动、最脆弱的环节;从描述生成数据集被视为极难的 agentic 任务,难点在于随样本量扩大出现多样性坍缩(diversity collapse)与质量下降。
- 团队将 Invent API 与 Anthropic、Google、OpenAI、DeepSeek、智谱(Zai)等 API 以及开源权重模型对比,覆盖不同任务、领域、语言,样本量 200 到 20,000。
- 结果:Invent 生成的数据集比所有受测模型多样性高 19%-55%,质量比最强基线(Claude Opus 5)高约 17%,在多样性与质量上同时占优(帕累托前沿)。
- 与部分不允许用其合成数据做训练的厂商不同,Invent 明确允许下游商业训练用途。
所属事件:Adaption AI 发零数据造训练集研究 质量多样性齐升(3 条相关)→
「模型」频道最新
- Cloudflare 开源 Jev 替代品 clef-flash,含 Qwen3.5-9B 轻量版 — victormustar · 2026-10-02
- Vercel CEO 证实微软 AI 正训练优秀模型,将实现零日接入 — tekbog · 2026-10-02
- 复刻 1994 年 Theme Park,实测 GPT-6.1 Sol 对战 Claude Opus 5.5 做游戏 — rschu · 2026-10-02
- OpenAI 官方重发 dots demo:这次换了更好的 WiFi — OpenAIDevs · 2026-10-02
- 网友晒疑似未发布模型名单:Opus 5.5、Fable 5.1、Sol 6.1 在列 — sloppenheimer · 2026-10-02
- JevBench 改用 Capability Score 计分,原版 Jev 重返榜首 — airesearch12 · 2026-10-02