TerminalBench 计分口径不一:Astra 触发安全得 0 分,Fable 却换模型续跑
xeophon · x · 2026-09-15
xeophon 指出公开的 TerminalBench traces 存在计分口径问题:Astra 触发安全分类器后 rollout 被终止并计 0 分,而 Fable 遇到类似情况却被改路由到 Opus 继续运行。两种处理方式差异使得榜单分数难以直接比较,对评测公信力提出质疑。
「模型」频道最新
- 内部人士预告:OpenAI 本周还有多条重磅发布待出 — MickeySteamboat · 2026-09-15
- 用户吐槽订阅档位失衡:$200 档 20× 用量 vs $100 档仅 5× — NoOne_n13 · 2026-09-15
- 传 OpenAI 暂停 $200 ChatGPT Pro 新订阅,称 GPT-6 Astra 需求挤爆容量 — emmanuelvivier · 2026-09-15
- 重度 vibe coding 实测:Claude Pro 体验胜过 ChatGPT Plus — AdvertisingBubbly546 · 2026-09-15
- 用量化金融类比 AI 竞赛:大厂先发优势终将随算法公开而消散 — willcb · 2026-09-15
- 覆盖度实测三轮:DeepSeek V4.1 Flash 21.7→33 分 — PawelHuryn · 2026-09-15