GEPA 优化提示词,把 Jev 医学文献任务 F1 从 69.1% 提到 79.7%
matei_zaharia · x · 2026-09-21
Matei Zaharia 转发一篇实践指南:作者用 TypeSafe AI 的「System One」决策模型 Jev 在公开医学文献上识别药物不良事件句子。首轮实验中,Jev 输出格式全部通过校验,但 300 句测试集有 54 句与标注不符——它几乎找全了阳性句,却大量误报阴性句,且有时以完全置信度给出错误答案。作者随后接入提示词优化器 GEPA:由助手基于训练错误提出指令修改候选,GEPA 评估选出更优 prompt,明确每句所需的证据要素(药物、有害效应、关系)。在新测试集上,F1 从 69.1% 提升至 79.7%,概率误差近乎减半,但漏报增加两例。文章要点:
- Jev 于 2026 年 9 月 15 日早 acess 发布,输入文本与问题、返回选项+分数+概率,适合 Agent 工作流中的小型决策(检索相关性判断、模型路由、工具调用审核)。
- 官方宣称在选定工作流评测中比替代方案快 193.6 倍、便宜 444.6 倍。
- 核心教训:输出合法不等于可信,「拿到有效决策容易,决定是否信任它才是难点」,用错误样本驱动 GEPA 改写指令是有效的领域适配路径。
附随文附 notebooks 与代码。
「编程与Agent」频道最新
- HarnessRouter 开源:一个 API 统一调度 Codex、Claude Code 等多款 Agent Harness — gaganghotra_ · 2026-09-21
- ECDYSIS 论文:Agent 运行时该按失败模式而非次数来修 — rohanpaul_ai · 2026-09-21
- LLM 应用在欧盟上线卡在哪?开发者盘点合规与工程五大关卡 — felix_baron · 2026-09-21
- 吐槽 Google Astra 编程 agent:开 PR 竟不给链接只说「PR 好了」 — altryne · 2026-09-21
- 开源项目 God's Eye View 把浏览器变成「间谍卫星」,一周狂揽 1 万 star — alex_verem · 2026-09-21
- Superlinear 长文:2026 年用编程 Agent 启动新项目的工作流 — samgoodwin89 · 2026-09-21