同款 Qwen-3.6-35B 下 Atomic Agent 跑赢 Hermes
kimmonismus · x · 2026-07-25
同样的 Qwen 模型和 M4 Max 下,Atomic Agent 跑赢 Hermes
这条帖子转述了一组 GAIA Level 1 实测结果:在 同一台 Apple M4 Max、同一个 4-bit Qwen-3.6-35B 模型下,Atomic Agent 比 Hermes 表现更好。
- Atomic Agent:53 题做对 37 题,69.8%,耗时 3 小时 12 分
- Hermes:53 题做对 31 题,58.5%,耗时 5 小时 10 分
- Atomic 多解 6 题,总耗时还 快了将近 2 小时
- 帖子强调它是一个 MIT 许可的开源 Agent Runtime
附带的细节还显示,Atomic 在超时题上的效率更高,失败题目消耗的总时间占比更低。
所属事件:开源Atomic Agent在GAIA基准上击败Hermes(3 条相关)→
「编程与Agent」频道最新
- Perplexity 推出 CLI,让编程智能体能直接联网搜索 — AravSrinivas · 2026-07-25
- 单条提示词生成3D游戏,Opus 5 编程能力惊艳 — chrisfirst · 2026-07-25
- 用代理拦截所有调用,能高效调试 agent 技能 — Daniel_Farinax · 2026-07-25
- GPT-5.6 Sol 在 DeepSWE 以 72.7% 领先 Opus 5 — rohanpaul_ai · 2026-07-25
- Nimbus 发布:面向智能体的开源 Astro 文档框架 — irvinebroque · 2026-07-25
- 创意机构实战:用Slack集成AI Agent自动化素材收集 — beechinour · 2026-07-25