同样本地 Qwen-3.6-35B,开源 Agent 在 GAIA 上反超 Hermes
SucceededMind · x · 2026-07-25
编排层比“堆更大权重”更重要,这条帖子转述了一次本地 agent 的对比实测。
在同样的本地环境下——4-bit Qwen-3.6-35B + M4 Max——Atomic Agent 和 Hermes Agent 被放到 53 个 GAIA Level 1 任务上测试:
- Atomic Agent:69.8% 解决率,耗时 3 小时 12 分
- Hermes Agent:58.5% 解决率,耗时 5 小时 10 分
也就是说,Atomic 多解决了 6 个任务,还比 Hermes 快近 2 小时。
帖子给出的解释是:Atomic 的 agent loop 更克制,尽量不浪费算力——通过 byte-stable prompt 复用 KV cache、把工具调用批量化成 JSON、并对结果做压缩,而不是把原始日志直接塞进上下文。
「编程与Agent」频道最新
- 别让 AI 自造成功标准:给它可验证目标才好用 — daniel_mac8 · 2026-09-11
- 开发者观点:前沿模型需要验证自身成功的方式,否则会自行编造 — daniel_mac8 · 2026-09-11
- Sakana AI 发布 Fugu Max:动态编排开源模型池逼近精英模型性能 — graceisford · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11