开源 Atomic Agent 以 69.8% 准确率超过 Hermes
rohanpaul_ai · x · 2026-07-23
一个开源本地 agent 在 GAIA 上超过了 Hermes
帖子称,Atomic Agent 是首个在 GAIA benchmark 上超过 Hermes 的开源本地 agent。
关键信息:
- 两个 agent 都在同样的 Qwen 3.6 35B 设置下测试,任务预算也一致。
- Atomic Agent 完成了 37/53 题,准确率 69.8%;Hermes 是 31/53,即 58.5%。
- 它的平均耗时也更低,约 217 秒/题,而 Hermes 约 351 秒/题。
- 作者强调,这个差距主要来自 agent loop 设计,而不是模型大小。
实现上,Atomic Agent 会输出经过语法检查的 JSON 工具调用数组,并行执行读取任务、汇总结果,同时复用缓存 prompt。底层的 TurboQuant 版 llama.cpp 还声称能把 KV cache 内存压缩到 6.4 倍更小,并带来 30%–50% 的解码加速。
所属事件:开源 Atomic Agent 在 GAIA 基准测试中超越 Hermes(2 条相关)→
「编程与Agent」频道最新
- 开源 Aster 提出分层验证的 LLM 代码审查框架 — letandrewcook · 2026-07-23
- SymbolPeek 让 AI 只读符号不读整文件,已省下 161 万 token — Real_Veterinarian851 · 2026-07-23
- 多智能体基准落后 39% 到 70%,AgenC 改用单 agent — tetsuoai · 2026-07-23
- AgenC 的 swarm 默认只开一个 agent,并给并行写作者隔离 worktree — tetsuoai · 2026-07-23
- AI 编程助手修数据库时连错六次,迁移文件膨胀到 400 行 — Comfortable-Roof4278 · 2026-07-23
- 五个前沿模型都能修 bug,但单次成本差 14 倍 — PromptPhanter · 2026-07-23