Teknium 回应评测争议:半数 Hermes 用户拿来写代码

Teknium · x · 2026-10-07

Nous Research 的 Teknium 回应网友对其 Hermes 模型评测基准的质疑。对方认为 terminal bench、科学类评测对个人助理场景无关,指数化综合榜单会误导日常用户以为必须用 Opus 5.5。Teknium 澄清:Hermes 不只是个人助理,各类能力有独立分榜,且 50% 的用户用 Hermes 做编码。双方就基准设计是否过拟合展开争论。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →