GEPA 优化提示词,把 Jev 医学文献任务 F1 从 69.1% 提到 79.7%

matei_zaharia · x · 2026-09-21

Matei Zaharia 转发一篇实践指南:作者用 TypeSafe AI 的「System One」决策模型 Jev 在公开医学文献上识别药物不良事件句子。首轮实验中,Jev 输出格式全部通过校验,但 300 句测试集有 54 句与标注不符——它几乎找全了阳性句,却大量误报阴性句,且有时以完全置信度给出错误答案。作者随后接入提示词优化器 GEPA:由助手基于训练错误提出指令修改候选,GEPA 评估选出更优 prompt,明确每句所需的证据要素(药物、有害效应、关系)。在新测试集上,F1 从 69.1% 提升至 79.7%,概率误差近乎减半,但漏报增加两例。文章要点:

附随文附 notebooks 与代码。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →