多智能体群蜂几乎无用:切块让 1-2B 小模型召回率从 0.3 升至 0.57
deadatreides1 · reddit · 2026-10-05
作者在 GTX 1660 SUPER 6GB 上做了一组预注册实验:六个 1-2B 小模型组成「苏联设计院式」swarm,处理长上下文抽取任务(每任务 18 条记录挑出符合条件的),并用脚本把输入切成 3 块、每块独立投票、用代码校验 id 剔除幻觉。
关键发现:
- 单模型全量读入时 recall 从位置 0 的 0.609 单调跌到位置 17 的 0.214——模型越往后越倾向说「没有」。
- 按学科切块后,头尾差距从 0.204 缩到 0.021(缩小 10 倍),位置不再影响结果。
- 分块收益远大于多模型协作:swarm 相对最佳单模型同管线只多 +0.05(0.900 vs 0.850),「严格涌现」为零;跨块校验在这类任务里也没活干。
- 模型越弱提升越大:qwen2.5-coder-1.5b 从 0.175 涨到 0.700,gemma-3-1b 几乎不会此任务;smollm2-1.7b 两种方式都是 0——组织架构救不了能力缺失。
实用建议:别把一堆文档一次性喂给小模型;切块跑、用代码而不是另一个模型来校验(作者称 model-as-judge 比想象的更差)。局限:仅 1-2B 模型、单一任务族、40 个任务,更大模型收益预计缩水。
「编程与Agent」频道最新
- MicroFactory 推出 AI 机器人集成器:自动设计夹具、写视觉代码、指挥机器人 — ihorbeaver · 2026-10-05
- Linear 客户周日早上报 Bug,AI Agent 自动修复并开出 PR — jeff_weinstein · 2026-10-05
- 把 AI 记忆做成身份连续性实验:448 条记忆、4606 个链接 — RileyRalmuto · 2026-10-05
- 免费提示词优化重复 Agent 任务,实测省 90% 以上 token — vivekhaldar · 2026-10-05
- 开发者用 Codex 搭游戏工具链:模拟武器法术与怪物物理反应 — Dimillian · 2026-10-05
- OpenAI dots 桌面 agent 被指仓促:实测对比 Grok Bot 全面落败 — alexisgallagher · 2026-10-05