LiveBench 现存漏洞易被刷榜,将推 2.0 版
bindureddy · x · 2026-08-23
Bindu Reddy 指出 LiveBench 在代理编码任务上容易被“刷榜”,并指出目前排行榜上一些排名(如 Qwen 27B 超越 GPT 5.6)不可信。团队正在开发更难被刷榜的 LiveBench 2.0。
所属事件:LiveBench 基准测试易被刷榜,2.0 版开发中(2 条相关)→
「模型」频道最新
- Opus 5 被曝逼近 Anthropic 内部水平,擅长目标优化 — scaling01 · 2026-08-23
- GLM-5.3 替代 Fable:分数涨 11 点成本降一半 — zainhas · 2026-08-23
- DeepSWE 实测:GLM-5.3 成本仅为 Fable 5 的 1/4 — zainhas · 2026-08-23
- Ox Alpha完整DeepSWE跑出63%,或为GLM-5.3 Flash — kimmonismus · 2026-08-23
- MiniMax 音乐模型被指未发布编码器 — kalomaze · 2026-08-23
- 实测对比:Grok 频繁出错,Sol 挑战假设能力更强 — jdjohnson · 2026-08-23