翻遍垃圾桶捡回 gemma4:作者实测发现它工具调用远胜 Qwen
spammmmmmmmy · reddit · 2026-09-23
一位 Reddit 用户分享了自己 DIY agent 循环的实测经历:他写了一个简单程序,告诉模型可用工具,模型用 RUN: 前缀提议命令,作者批准或修改后反馈结果,循环推进直到任务完成。
实测发现:
- 主力模型 Qwen3.6 35B 和 Qwen3.8 27B 无法稳定遵循指令,上下文堵塞后陷入疯狂反馈循环——该用 ast-grep 的时候反复 cat 整个文件,输出中还泄漏了原始思考 token 和模板分隔符;
- 抱着试试看的心态换上 gemma4:12b,反而非常听话、准确执行指令;gemma4:26b 更进一步,还会规划工作、提出推进方案;
- 作者甚至回测了 Qwen2.5:3b-instruct(据称专为工具调用训练)。
作者结论:模型在「有创造力」和「听话守规矩」之间可能存在取舍,并发起讨论各家工具调用体验。
「编程与Agent」频道最新
- 双模型分工:MatBrain 用 48 小时筛选 3 万个晶体候选材料 — bravo_abad · 2026-09-23
- Firecrawl 获 7500 万美元 B 轮融资,并推出智能体知识库 Alexandria — omarsar0 · 2026-09-23
- 5 个 AI Agent 十分钟绕过权限代理:用 start 绕开 stop 黑名单 — TrifleHopeful5418 · 2026-09-23
- Shopify CEO 强推 AI 后自曝遭反噬,「Slop Grenades」引发热议 — srchvrs · 2026-09-23
- Lovable 接入 Claude Opus 5.5 与 GPT-6 Sol 双模型 — AlexandrePesant · 2026-09-23
- 开发者吐槽:Agent 架构被 KV cache 绑架,盼推理专用芯片 — dbreunig · 2026-09-23