Nous Research 推出 Hermes Index 智能体榜单,Claude Opus 5.5 居首
NousResearch · x · 2026-10-07
Nous Research 发布 Hermes Index——一个衡量模型在 Hermes Agent 中实际表现的基准平均值榜单,旨在帮用户选模型、也让各家实验室看到自己在 Hermes 框架内的真实水平。
榜单由四个基准取平均构成:新自研的 Hermes Bench、Terminal-Bench 4.0、Terminal-Bench-Science 和 SkillsBench。所有模型跑同一套 harness,支持推理的模型将推理强度调至最高,报告平均得分与平均单任务成本。
- Claude Opus 5.5 以 63.31 分居首,单任务均价 $4.99
- GPT 6 Astra 第二,56.25 分,单任务 $11.61(成本最高)
- Claude Sonnet 5.5 第三,53.14 分,$2.82
- 尾部:DeepSeek V4.1 Flash 得 36.91 分、$0.26;Ling 3.0 Flash 得 21.56 分、仅 $0.054
所属事件:Nous Research 发布 Hermes Index 智能体榜单,Claude Opus 5.5 居首(4 条相关)→
「编程与Agent」频道最新
- raindrop_ai 联创对谈:如何捕捉 AI Agent 失灵与安全讨论盲区 — soleio · 2026-10-07
- IR4RL:把中间渲染进度变成 RL 奖励,Image-to-Code 达新 SOTA — phillip_isola · 2026-10-07
- 企业 AI 采用意愿达峰值,文章详解如何把技能转化为 Agent — vasuman · 2026-10-07
- OpenAI Decisions API 联动 Live API:让语音 Agent 边听边做 — pbbakkum · 2026-10-07
- 单张 RTX 5090 跑 27B 模型 256k 上下文,110+ tokens/s — Ok-Shower7286 · 2026-10-07
- Google 测试博客谈「双向门」:别把代码写进退不回的死角 — rseroter · 2026-10-07