Nous Research 推出 Hermes Index 智能体榜单,Claude Opus 5.5 居首

NousResearch · x · 2026-10-07

Nous Research 发布 Hermes Index——一个衡量模型在 Hermes Agent 中实际表现的基准平均值榜单,旨在帮用户选模型、也让各家实验室看到自己在 Hermes 框架内的真实水平。

榜单由四个基准取平均构成:新自研的 Hermes Bench、Terminal-Bench 4.0、Terminal-Bench-Science 和 SkillsBench。所有模型跑同一套 harness,支持推理的模型将推理强度调至最高,报告平均得分与平均单任务成本。

所属事件:Nous Research 发布 Hermes Index 智能体榜单,Claude Opus 5.5 居首(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →