NVIDIA Data Designer 实战:5 万种子造出教会模型搜索的训练数据
AI Engineer · youtube · 2026-10-12
AI Engineer 大会工作坊,NVIDIA 的 Dhruv Nathawani 演示用 Data Designer 构建合成数据流水线,教模型学会「搜索」而非凭记忆作答。
核心流程
- 以 Wikidata 实体图谱路径为种子,把相连实体变成需要多次搜索才能解开的「搜索谜题」;5 万条种子经生成与过滤收敛为 7000 条训练记录。
- 用 Tavily 通过 MCP 提供搜索工具,生成完整的问题、工具调用与响应轨迹,用于监督微调(SFT)或蒸馏,也讨论了 RL 替代方案。
三个 Notebook 分阶段搭建
- 结合种子话题、难度采样器、prompt 模板、结构化输出与模型评审生成问答对;先预览少量记录再批量生成。
- 接入工具并采集搜索轨迹。
- 从图谱路径生成端到端搜索数据与完整轨迹。
关键经验:当源图谱本身可能过时,验证答案正确性很难,需结合模型评审、确定性检查与人工复核;用合成 persona 保持人口统计分布。总原则是——为多样性设计、检查样本、过量生成再过滤、对配方做版本管理。
「编程与Agent」频道最新
- LangChain 创始人提出企业 Agent 身份三种模式 — hwchase17 · 2026-10-12
- JAX 可跑 Apple GPU:jax-graft 用 Opus 5.5 写成开源后端 — twiecki · 2026-10-12
- 想避免 AI 味网页?别用 shadcn 和 Tailwind 常规栅格 — michalmalewicz · 2026-10-12
- 学生求助:用 Claude Code 写规格、Antigravity 干活仍总漏细节 — 3ATAE · 2026-10-12
- 2 亿篇论文免费语义搜索开放:一条命令把文献库装进 AI agent — pbaylies · 2026-10-12
- CC Switcher 开源:Windows 上一键并行运行多个 Claude Desktop 账号 — zeeg · 2026-10-12