个性化基准 noahbench 重发:Top3 是 Fable 5.1、Grok 4.7、Opus 5.5
sarahcat21 · x · 2026-09-29
- 开发者 Noah 重发了自建的 noahbench™ 基准:基于自己每天解决的真实任务来评估模型输出质量,属于刻意「个人化」的评测框架。
- 他的 Top 3 模型为:Fable 5.1、Grok 4.7、Opus 5.5。
- 引用者 Sarah Cat 据此提出:行业正进入定制化时代(per-customer / 个性化模型),这不仅需要新的建模方法,还需要能规模化基准与评测、并监控/更新/编排成百上千个模型的工具链。
「模型」频道最新
- 社区实测:MiMo-V2.6-Pro 约 17% 参数可删,性能几乎不变 — QuixiAI · 2026-09-29
- Image JevBench v0.1.4 上线:Imajev-4B 居首,Wity-1 以 74.36 分列第二 — airesearch12 · 2026-09-29
- 用 Opus 5.5 做出硅变芯片的交互式 3D 滚动讲解页 — threepointone · 2026-09-29
- 为何简单的 steering 向量能左右复杂模型?新文给出三点直觉 — gleech · 2026-09-29
- OpenAI 上午 10 点发布会前推送更新,用户自定义贴图被替换 — whurley · 2026-09-29
- UsageBench 上线:持续复测订阅额度,专防厂商暗中砍量 — alejandroll10 · 2026-09-29