70M 参数代码检索器超越 300M 模型,ColGrep 给 grep 加上语义
CShorten30 · x · 2026-09-16
Weaviate Podcast #134 访谈 LightOn 团队(Amélie Chatelain、Antoine Chaffin),核心内容:编码智能体让 grep 出圈,而 grep 本质也是检索,可以被赋予语义。要点:
- LightOn 训练了可在笔记本本地为代码库建索引的 late interaction 模型,其中 70M 参数的代码检索器性能超过最高 300M 的所有对比模型
- 集成进 ColGrep:保留智能体已熟悉的正则与文件过滤,叠加语义匹配
- 效果:减少重复查询、降低搜索 token 消耗,最难查询上的答案质量更好
- 播客还覆盖推理密集型检索、patch 级向量的多模态搜索,以及用开源 PyLate 库从零训练的 late interaction 模型 ColBERT-Zero
「编程与Agent」频道最新
- Codex ultra 模式遭吐槽:子 agent 一多输出全是 slop — wstone_bd · 2026-09-16
- 实测同一函数本地 500ms 生产 7000ms:云端机器可慢 14 倍 — DanielLockyer · 2026-09-16
- 笔记引用偏差 5 天后才暴露,作者定下「存源 URL+原文」铁律 — Agent-OmegaLT · 2026-09-16
- Exa 创始人:2026 年机器搜索量将首超人类,差距可达千倍 — AI Engineer · 2026-09-16
- blender-mcp 更名 mcp-for-blender,老配置无需改动 — sidahuj · 2026-09-16
- 两个 2-4B 小模型实测客服任务:100 分 vs 84 分差在最后一公里 — Equivalent-Grass-527 · 2026-09-16