单谱系优化器 NPO 匹配复杂 GEPA,大幅简化提示词优化
omarsar0 · x · 2026-08-31
一篇关于提示词优化的新论文提出 NPO (Nested Prompt Optimization),它仅维护单谱系而非候选池或搜索树,就能在更小的 rollout 预算下匹配复杂方法 GEPA 的性能。
核心机制:
- 在每次迭代中,NPO 运行当前提示词,收集轨迹和奖励。
- 将滑动窗口内的迭代历史交给教师模型重写提示词。
实验结果:
- 在两个指令遵循基准上,NPO 分别消耗 3,500 和 6,800 次 rollout,表现与 GEPA (3,593 和 6,871 次) 相当。
- 在 22 个 TextArena 游戏中表现也具有可比性。
- 关键发现: 教师模型越强,NPO 的优势越明显,这表明优化器侧的搜索复杂度可能被高估了。
「研究」频道最新
- Hamel Husain 推出更新版 AI 评测实战课程 — HamelHusain · 2026-08-31
- 新论文提出「AI 45°定律」:安全与能力协同进化路线图 — CFGeek · 2026-08-31
- 40 位顶尖学者联名论文:CoT 监控是 AI 安全的新机遇 — peterjliu · 2026-08-31
- AI 可全自动检查学术论文稳健性,甄别数据选择偏差 — paulnovosad · 2026-08-31
- Mathathon 竞赛强推透明:公开算力、日志与结果 — _sathvikr · 2026-08-31
- Claude 编写量子计算机控制器,10秒修复故障 — imjustnewatai · 2026-08-31