小模型胜过大模型?Jev 在 Agent 代码搜索基准中击败 DeepSeek 与 grep

bothlabs · reddit · 2026-09-29

作者构建了一个扩展版 CodeSearchNet Challenge 基准(5 种语言、470 次搜索、每工具约 23.5 万次是/否判断),对比三种 agent 代码检索方式:agent 自写模式的 grep、逐函数提问的 DeepSeek V4.1 Flash、以及 TypeSafe 的小型 System 1 模型 Jev(通过作者开源的 jevpipe CLI 运行)。

结果(F1):Jev 0.67、DeepSeek 0.64、grep 0.52。两个模型都明显胜过 grep——例如搜 "matrix multiply" 时 grep 模式一个都没命中(实际函数名为 mul、multiply 等),Jev 找到全部 8 个。Jev 对 DeepSeek 优势不算稳(93% 重采样中领先),但在所有召回率阈值下精确度更高,速度约快一倍且略便宜(每千文件 $0.020 vs $0.022)。

校准度:Jev 越自信越准(55%→98%),DeepSeek 对 94% 的答案给出 0.9+ 置信度但实际正确率仅 51–59%,难以据此排序。

两条普适提示词经验:① 问代码而非问搜索者——"这个函数是否实现了 X" 比 "这是不是搜索者想要的" 高 0.03–0.11 F1;② 不问代码看不出的属性——"高效读 CSV" 会失败,改问 "是否读 CSV" 再用别的方式过滤速度。

局限:单一任务、单一评判 LLM、2019 年代码可能已入训练集。数据集已开源在 Hugging Face。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →