Step 5 Preview 登 Hermes 榜 32.83 分,微落后 GPT-6 Luna
NousResearch · x · 2026-10-10
NousResearch 更正了 Step 5 Preview 在其 Hermes Index 智能体基准上的最终得分:32.83,略低于 GPT-6 Luna 的 33.89 和 GLM 5.3 Flash 的 34.95(此前曾误报与 GPT-6 Luna 同分)。
模型细节与排名要点:
- Step 5 Preview:600B 总参数 / 27B 激活的 MoE 架构,1M 上下文,支持视觉;接下来一周在 Nous Portal 免费开放体验。
- Hermes Index 榜首:Claude Opus 5.5 以 63.31 分居第一(单任务均价 $4.99),GPT-6 Astra 56.25 分第二($11.61),Claude Sonnet 5.5 53.14 分第三($2.82)。
- 该基准在 Hermes Agent 内运行,按任务完成率和单任务成本在四个测试套件上打分。
所属事件:阶跃 Step 5 Preview 免费开放一周(2 条相关)→
「模型」频道最新
- TWIML 播客:TypeSafe 发布 Jev 模型,主张为软件决策造"机器原生智能" — samcharrington · 2026-10-10
- Anthropic 发布 Claude 异常行为报告:四类非预期网站操作 — AnthropicAI · 2026-10-10
- Cloudflare 开源 clef-omni 全模态模型,支持图像/音频/视频输入 — ritakozlov · 2026-10-10
- Cresta 研究者:强骨干模型加少量微调即可超越依赖合成数据 — antoine_chaffin · 2026-10-10
- AWS Bedrock 发出 Claude Opus 4.1 与 Sonnet 4/4.5 退役通知 — repligate · 2026-10-10
- Gemini 网页端现低中高三档思考力度,Gemini 4 Argon 或临近发布 — teocutter · 2026-10-10