1.5B 小模型实测:来源分级验证让本地 Agent 不再「自信地错」
UzairArain554 · reddit · 2026-09-06
作者在纯 CPU 本地环境(Qwen2.5-1.5B + llama.cpp)做了一个实验:教 agent 区分官方文档与随机博客,能否减少「自信的错误」。
关键发现
- 朴素版管线:搜索后把所有来源一律当「可信」存储,7 条答案全部打上相同的置信标签,完全不分来源优劣。
- 验证版管线:按信任层级分类来源 + 对生成代码做语法检查,7/7 正确区分了来源质量。
- 顺带发现真 bug:一个「自信满满」的文件上传校验器只检查扩展名和 MIME 类型,两者都极易伪造;朴素管线会以满置信度放过它。
- 小模型的格式局限:OpenAI 风格 JSON tool-calling 在 1.5B 模型上 0/5 失败——llama.cpp 只在 7B 以上才验证原生 tool-calling。换成极简文本约定(SEARCH: <query>)后 5/5 成功。
结论:小模型能做出正确决策,只是常常无法按「标准」格式输出;简单文本协议是可用的替代方案。附 repo 与完整调试日志(含死胡同)。
「编程与Agent」频道最新
- 研究员飞机上实测 Codex+Astra:三窗口并行搞定报销签证 — soumitrashukla9 · 2026-09-06
- 开发者开源 PLLDN:LLM 不该决定你的技术栈 — KeilerHirsch · 2026-09-06
- 用户喊话愿为 Claude Code 每月 500 美元买 50 倍用量 — GabGarrett · 2026-09-06
- 「Vibe coder」 比「提示词工程师」更好?圈内争论 — BLUECOW009 · 2026-09-06
- SkillGLoW:存方法不存任务,agent 记忆库缩小 3.6 倍还涨 17.2 分 — rohanpaul_ai · 2026-09-06
- dotey 长文驳「Codex 驾驭不了 Astra」:Harness 无法被模型内化 — dotey · 2026-09-06