NPO 论文:Prompt 优化靠好老师反馈,未必需要搜索树
rohanpaul_ai · x · 2026-09-02
- 论文对比 NPO 与 GEPA 两种 prompt 优化方法:GEPA 维护多个 prompt 候选并用 Pareto 选择,NPO 只保留单条 prompt 谱系,让 teacher 模型根据最近的 rollout 轨迹和奖励进行修订。
- 结论:NPO 能与 GEPA 打平甚至更好,提示 prompt 优化的关键可能不在搜索算法的复杂度,而在于 teacher 模型的质量及其反馈。
- 对做 prompt 工程的人是一个反直觉信号:与其堆搜索结构,不如把修订反馈循环做好。
所属事件:NPO 论文:提示词优化无需搜索树,教师模型质量更关键(2 条相关)→
「研究」频道最新
- Schmidhuber 谈 OpenAI「递归深度」:就是我 2015 年的思路 — SchmidhuberAI · 2026-09-03
- Schmidhuber 谈循环深度:2015 年论文已提出抽象空间内思考 — SchmidhuberAI · 2026-09-03
- 开源检索研究者 Matthew Yang 入读 MIT 读博 — lateinteraction · 2026-09-03
- 大学医院系统新闻稿与论文数据被指严重脱节 — EricTopol · 2026-09-03
- 斯坦福论文提出双向扩散桥,统一文生图与图生文反演框架 — burkov · 2026-09-03
- Hugging Face 工程师开源 abcGPT:从百万声音中调出你要的文风 — iamtrask · 2026-09-03