开源本地 prompt 优化器:GEPA 驱动 llama3.2 3B 分类准确率 39%→89%

MortisAndTen · reddit · 2026-09-09

作者受够了「发云端 API、给个重写就完事」的 prompt 优化器,基于 DSPy + Ollama 构建了 fully local 的 PromptCraft(MIT 开源):粘贴 prompt 即得重写、评分与 diff;给 10-20 个输入输出样本后,每个候选(原版、重写、few-shot 变体)都在 held-out 样本上实测打分(支持 k-fold/固定切分、分层),few-shot 示例用 nomic-embed-text 按覆盖率挑选,还带 lineage 视图与逐代 word diff。

实测(llama3.2 3B,M4 Pro,18 个工单分类任务):

最有意思的发现:基线失败模式是正确答案埋在解释句里,评估反馈直接指出「答案在响应里但埋在 38 个词中」,而 GEPA 自己进化出的胜出 prompt 以「用一个词作答」结尾——3B 模型自主走通了这条路。另有差评转约束、并排试跑、本地数据集生成去重等功能。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →