PostTrainBench v1.2 发布:Fable 5.1 登顶,新增 Harbor 支持
maksym_andr · x · 2026-10-02
PostTrainBench(PTB)发布 v1.2,更新后模型排名为:Fable 5.1 > Opus 5.5 > GPT-6 Astra > Fable 5。本次更新要点:
- 新增 Harbor 支持,大幅简化 PTB 的运行流程;
- 移除 BFCL 评测(详情见原帖说明);
- 修复若干打分 bug;
- reward hacking 判定与最终评估改为多次运行取结果,以降低方差。
PTB 专注于衡量模型训练后阶段(post-training)的实际表现,此次也顺带给出了新一代前沿模型的相对座次。
所属事件:PostTrainBench v1.2 发布:Fable 5.1 登顶(2 条相关)→
「模型」频道最新
- 9 月本地模型盘点:27B 塞进 5.9GB、手机级 35B 等数十款发布 — vramkickedin · 2026-10-02
- 用户实践:Gemini 新模型跑通宵开放式任务,日常交给 Flash — JMateosGarcia · 2026-10-02
- 爆料称 Google 内部已有比 Argon 更强的模型(未证实) — Independent-Wind4462 · 2026-10-02
- Chollet:base 模型零流体智力,ARC 1 扩容 10 万倍仅到 10% — fchollet · 2026-10-02
- 用户实测:ChatGPT 聊天对话也在悄悄扣 Codex 额度,与官方文档相反 — jonistaken · 2026-10-02
- Grok 4.7 开始在网页与移动端推送,覆盖 Fast/Expert/Build/Heavy 全模式 — testingcatalog · 2026-10-02