PostTrainBench v1.2 更新:Fable 5.1 以 44.6% 登顶训练后基准
karinanguyen · x · 2026-10-02
PostTrainBench 发布 v1.2 版本,主要变化:
- 云 GPU 支持:新增 Harbor 适配器,可通过 Harbor + Modal 以完全相同的设置在云端运行基准
- 榜单刷新:Fable 5.1 以 44.6% 登顶,Opus 5.5 以 43.8% 居次,GPT-6 (Astra) 41.9% 第三
- 评测修复:移除 BFCL,修复 HumanEval 与 remote-code 评分,加入多种子平均,污染检查改为多数投票
该基准聚焦模型训练后(post-training)阶段能力,评测方法学更稳健了。
所属事件:PostTrainBench v1.2 发布,Fable 5.1 登顶榜单(3 条相关)→
「模型」频道最新
- Nat Eliason 疑测 @bot 已换用 4.7,称其本周明显变聪明 — nateliason · 2026-10-02
- 多名用户称被路由至 Fable 5.5,SVG 测试远超 5.1 版本 — kimmonismus · 2026-10-02
- 180B 模型塞进单台 DGX Spark:2.39-bit 量化仅损失 4.5% — TheZachMueller · 2026-10-02
- 网友拆解Claude云session计费:赠token只能云端烧 — stablequan · 2026-10-02
- 一句 please continue 烧光 5 小时额度:6.5 分钟用尽引质疑 — thawingfrog · 2026-10-02
- Grok 4.7 已悄然上线网页版 — rohanpaul_ai · 2026-10-02