NPO 论文:提示词优化无需搜索树,教师模型质量更关键
一篇新论文提出 NPO(单谱系优化)方法,挑战了 prompt 优化的主流思路。与 GEPA 维护多个 prompt 候选并用 Pareto 选择的策略不同,NPO 只保留单条 prompt 谱系,让教师模型提供反馈迭代。实验对比显示,精巧的搜索算法或许并非必需,真正决定优化效果的是教师模型的质量与反馈,这为 prompt 优化提供了更简洁的路径。
2026-09-02 ~ 2026-09-02 · 2 条相关
- NPO 论文:Prompt 优化靠好老师反馈,未必需要搜索树 — rohanpaul_ai · 2026-09-02
- NPO 论文:提示词优化或不需要搜索树,教师模型质量更关键 — rohanpaul_ai · 2026-09-02