Teknium 回应评测争议:半数 Hermes 用户拿来写代码
Teknium · x · 2026-10-07
Nous Research 的 Teknium 回应网友对其 Hermes 模型评测基准的质疑。对方认为 terminal bench、科学类评测对个人助理场景无关,指数化综合榜单会误导日常用户以为必须用 Opus 5.5。Teknium 澄清:Hermes 不只是个人助理,各类能力有独立分榜,且 50% 的用户用 Hermes 做编码。双方就基准设计是否过拟合展开争论。
「模型」频道最新
- Grady Booch 转述专家热议:AI 数学求解是突破还是对数学家的 DDoS — Grady_Booch · 2026-10-07
- OpenAI 模型 3 小时攻克悬置多年的 GitHub 难题,网友直呼跟不上了 — birchlse · 2026-10-07
- WebDev Arena 榜单:claude-opus-5.5-max 以 1814 分登顶 — arena · 2026-10-07
- 仅2万参数81KB的语言模型,也能写出有起承转合的完整故事 — x_Raincandy_x · 2026-10-07
- Mistral Large 4 网安基准反超 Opus 5.5 与 GPT-6,全因拒绝率更低 — burny_tech · 2026-10-07
- 独立模型 Auro 发布 V9:对战 V9 胜率约 10:1 压制 V8 — TheMoonMidas · 2026-10-07