研究发现 RL 强提示词无需更多细节,精简反而更优

xeophon · x · 2026-08-25

转推的一篇文章指出,在强化学习(RL)运行中,使用强提示词进行 Seeding 往往能带来更好的结果。文章强调,强提示词不一定意味着包含更多详细信息。在 GEPA 的案例中,删除了 400 行参考规范后,模型反而成功生成了预期的图像。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →