开源本地 prompt 优化器:GEPA 驱动 llama3.2 3B 分类准确率 39%→89%
MortisAndTen · reddit · 2026-09-09
作者受够了「发云端 API、给个重写就完事」的 prompt 优化器,基于 DSPy + Ollama 构建了 fully local 的 PromptCraft(MIT 开源):粘贴 prompt 即得重写、评分与 diff;给 10-20 个输入输出样本后,每个候选(原版、重写、few-shot 变体)都在 held-out 样本上实测打分(支持 k-fold/固定切分、分层),few-shot 示例用 nomic-embed-text 按覆盖率挑选,还带 lineage 视图与逐代 word diff。
实测(llama3.2 3B,M4 Pro,18 个工单分类任务):
- Meta-prompt 重写 + 5-fold:原版 44%,重写单独 39%(更差),重写+4 示例 50%——工具会如实告诉你重写失败了。
- GEPA 默认 80/20 切分、3 个 seed:无提升,工具把原版退回。
- GEPA 50/50 切分:50→67、28→44、39→89,单次运行 34-50 秒。作者坦诚 GEPA 在同一 held-out 集上选择也用于报告,数字偏乐观,18 个样本不算 benchmark。
最有意思的发现:基线失败模式是正确答案埋在解释句里,评估反馈直接指出「答案在响应里但埋在 38 个词中」,而 GEPA 自己进化出的胜出 prompt 以「用一个词作答」结尾——3B 模型自主走通了这条路。另有差评转约束、并排试跑、本地数据集生成去重等功能。
「编程与Agent」频道最新
- Eraser 开源 AI 原生坐标感知图表格式,MIT 协议 — yawnxyz · 2026-09-09
- 代码格式化之争 40 年前已解决:Ada 用 DIANA 中间表示取代源码存储 — maxleiter · 2026-09-09
- QA 工程师用 Codex 学 DevOps:Agent 端到端修复代码引发学习焦虑 — Recent-Tangerine2745 · 2026-09-09
- WebMCP 走热:工具直接嵌入网页,浏览器内任意 Agent 免服务器调用 — every · 2026-09-09
- Reducto Extract 大升级:速度翻倍、 citation 覆盖 99%,定价 2 美分/页 — ycombinator · 2026-09-09
- Vercel 改用 CDN 包月定价,告别流量尖峰天价账单 — cramforce · 2026-09-09