NPO 论文:提示词优化或不需要搜索树,教师模型质量更关键
rohanpaul_ai · x · 2026-09-02
一篇新论文挑战了 prompt 优化的主流思路:也许根本不需要精巧的搜索算法,真正起作用的是教师模型的质量与反馈。
核心方法
- NPO(单谱系优化):只保留一条 prompt 谱系,让教师模型根据最近的 rollout 轨迹和奖励信号来迭代修订它。
- 对比对象是 GEPA:维护多个 prompt 候选并用 Pareto 选择机制筛选。
实验结果
- 在 IFBench 和 HotpotQA 上,NPO 达到与 GEPA 相当或更好的成绩,rollout 还略少:3,500 vs 3,593、6,800 vs 6,871。
- 教师模型越强,NPO 优势越大:换用 DeepSeek-V4-Flash 尤其是更强的教师后,NPO 的提升比 GEPA 更稳定,说明「更强的教师推理 + 丰富反馈」可以替代优化器侧的搜索。
- 优化后的 prompt 还能迁移到其他学生模型,尤其在同一模型家族内效果最好。
结论:prompt 优化的瓶颈可能不在搜索结构,而在反馈质量——投资更强的教师模型可能比设计更复杂的搜索更划算。
所属事件:NPO 论文:提示词优化无需搜索树,教师模型质量更关键(2 条相关)→
「编程与Agent」频道最新
- 「My 2T Token Life」:开发者晒 Agent 编码 token 消耗 — doodlestein · 2026-09-02
- DeepMind 发布 Gemini 3.8 Flash 与网络安全专用的 3.8 Flash Cyber — GoogleDeepMind · 2026-09-02
- 一个 Claude Code Skill 全自动产出 8 部 AI 纪录片共 33 分钟 — illscience · 2026-09-02
- LangChain 强调模型供应商中立:「今天合适的模型下周未必合适」 — LangChain · 2026-09-02
- 一份常见的 Agent 技能模式分类图,开发者可按场景对号入座 — rseroter · 2026-09-02
- 实测重试策略:补错误反馈让本地模型解题率从 42% 升到 75% — BlubberingSense · 2026-09-02