Hermes Index 完整榜单:头部贵得有理,尾部模型成本仅 5 美分
NousResearch · x · 2026-10-07
Nous Research 公布 Hermes Index 各模型成绩与单任务成本:同一 harness、推理强度尽量拉满,报告四套基准的平均分与平均成本。
- Claude Opus 5.5:63.31 分,$4.99/任务
- GPT 6 Astra:56.25 分,$11.61/任务(全场最贵)
- Claude Sonnet 5.5:53.14 分,$2.82/任务
- DeepSeek V4.1 Flash:36.91 分,$0.26/任务
- Ling 3.0 Flash:21.56 分,$0.054/任务
结论指向清晰:头部模型得分差距明显,而性价比端与能力端差距同样巨大——Sonnet 5.5 以不到 Opus 6 成的价格拿到 53 分,尾部 Flash 模型以近零成本换低分。
所属事件:Nous Research 发布 Hermes Index 智能体榜单,Claude Opus 5.5 居首(4 条相关)→
「编程与Agent」频道最新
- OpenAI Decisions API 支持图像输入,13 美分挑出 40 分钟素材最佳表情 — stevenheidel · 2026-10-07
- Brain Co 推出面向 AI Agent 的设计系统 Synapse,把设计判断写进组件 — LVidegaray · 2026-10-07
- 开发者称旧 vibe coding 工作流反成劣势:直接说需求即可 — TheMoonMidas · 2026-10-07
- 开发者更新 Lerna 插件:Copilot CLI 可动态路由至微软 Foundry — unixterminal · 2026-10-07
- 观点:智能体正处「捆绑期」,下一波将是窄场景专用 Agent — signulll · 2026-10-07
- Google 与 MIT 发布 Coco:用智能体辅助 TPU 硬件-模型协同设计 — dair_ai · 2026-10-07