小模型胜过大模型?Jev 在 Agent 代码搜索基准中击败 DeepSeek 与 grep
bothlabs · reddit · 2026-09-29
作者构建了一个扩展版 CodeSearchNet Challenge 基准(5 种语言、470 次搜索、每工具约 23.5 万次是/否判断),对比三种 agent 代码检索方式:agent 自写模式的 grep、逐函数提问的 DeepSeek V4.1 Flash、以及 TypeSafe 的小型 System 1 模型 Jev(通过作者开源的 jevpipe CLI 运行)。
结果(F1):Jev 0.67、DeepSeek 0.64、grep 0.52。两个模型都明显胜过 grep——例如搜 "matrix multiply" 时 grep 模式一个都没命中(实际函数名为 mul、multiply 等),Jev 找到全部 8 个。Jev 对 DeepSeek 优势不算稳(93% 重采样中领先),但在所有召回率阈值下精确度更高,速度约快一倍且略便宜(每千文件 $0.020 vs $0.022)。
校准度:Jev 越自信越准(55%→98%),DeepSeek 对 94% 的答案给出 0.9+ 置信度但实际正确率仅 51–59%,难以据此排序。
两条普适提示词经验:① 问代码而非问搜索者——"这个函数是否实现了 X" 比 "这是不是搜索者想要的" 高 0.03–0.11 F1;② 不问代码看不出的属性——"高效读 CSV" 会失败,改问 "是否读 CSV" 再用别的方式过滤速度。
局限:单一任务、单一评判 LLM、2019 年代码可能已入训练集。数据集已开源在 Hugging Face。
「编程与Agent」频道最新
- 用 Claude Sonnet 5.5 写 3000 行 JS:程序化生成森林场景 — measure_plan · 2026-09-29
- 一条 ffmpeg 命令可视化视频中的运动:tblend 差分找出蜂群 — johnowhitaker · 2026-09-29
- Cline 桌面版发布后登 OpenRouter 热榜,升至第二大编码 Agent — cpaik · 2026-09-29
- 零代码写出 23 万行 AI 应用,作者公开上线前六步生产清单 — PawelHuryn · 2026-09-29
- SealKeeper:为 AI agent 建跨公司信誉评级系统,公开求破解 — nottobothered · 2026-09-29
- 户型图秒变可编辑 3D 房间,AI 编码 demo 玩出新花样 — alex_verem · 2026-09-29