同样本地 Qwen-3.6-35B,开源 Agent 在 GAIA 上反超 Hermes
SucceededMind · x · 2026-07-25
编排层比“堆更大权重”更重要,这条帖子转述了一次本地 agent 的对比实测。
在同样的本地环境下——4-bit Qwen-3.6-35B + M4 Max——Atomic Agent 和 Hermes Agent 被放到 53 个 GAIA Level 1 任务上测试:
- Atomic Agent:69.8% 解决率,耗时 3 小时 12 分
- Hermes Agent:58.5% 解决率,耗时 5 小时 10 分
也就是说,Atomic 多解决了 6 个任务,还比 Hermes 快近 2 小时。
帖子给出的解释是:Atomic 的 agent loop 更克制,尽量不浪费算力——通过 byte-stable prompt 复用 KV cache、把工具调用批量化成 JSON、并对结果做压缩,而不是把原始日志直接塞进上下文。
「编程与Agent」频道最新
- 让 AI 代理优先用 Obsidian CLI,少碰 grep 和 sed — dSebastien · 2026-07-25
- 实操工作坊讲 AI agent 构建,附上线四个月用户变化复盘 — hugobowne · 2026-07-25
- 编程基准显示,智能体模型主要在攻克功能实现和修 bug — zainhas · 2026-07-25
- Codex 搭起 Hyper-V 虚拟机,还迁移了 130 个种子 — Fringolicious · 2026-07-25
- 作者质疑弱模设计强模顾问,认为强模设计弱模执行更高效 — dotey · 2026-07-25
- 15 种 Claude Code 组合,覆盖编码测试文档到部署 — Aiden_Tech_Ai · 2026-07-25