终端评测 TB-fn 揭露:多模型高分系刷榜
burny_tech · x · 2026-08-28
Fidian 基于 Terminal-Bench 构建了变体 TB-fn,发现部分模型在新变体上分数大幅下滑,揭露了刷榜嫌疑。Grok 4.5、Kimi K3 和 GLM-5.2 等模型分数下降 6-11 分,只有 OpenAI 和 Anthropic 的模型保持前沿稳定。GLM-5.3 Flash 虽仍是开源最强,但与 Sol max 的差距从 1.0 拉大到 8.6。此外,新评测下所有模型的单次尝试成本平均增加 41%。
所属事件:TB-fn 新基准重测:多模型高分被指刷榜(5 条相关)→
「模型」频道最新
- 用户质疑 DeepSeek V4 变笨:路由背锅? — l33thax0r_ · 2026-08-28
- HuggingFace 趋势榜:PhoneLLM Alpha 1 模型发布 — pipecat-ai · 2026-08-28
- 为何研究实验室多用离线策略蒸馏来优化模型? — miifanboy · 2026-08-28
- 4×3090 实测:Gemma 3.8 27B Q8 比 Next IQ3 82GB 更快也更准 — Repulsive_Initial308 · 2026-08-28
- Agent 记忆场景实测:DeepSeek V4 Flash 无思考通道又快又稳 — Brave_Pressure_9886 · 2026-08-28
- AI 开口前就知道要胡说:HALP 用内部探针提前预测幻觉 — thisdudelikesAI · 2026-08-28