研究者质疑基准评测异常:新模型竟全面不敌旧一代
BlackHC · x · 2026-10-01
研究者 BlackHC 连发推质疑某基准的评测数据:他的预期是新一代模型应全面优于旧代,但榜单上完全不成立,其他相关数字也不正常。他直接向相关方追问该基准整体评测口径出了什么问题,暗示评测结果可能失真或有其他隐情。
所属事件:研究者质疑某基准评测数据异常:新模型竟不及旧一代(2 条相关)→
「模型」频道最新
- 用户质疑 Suno 训练数据含 SoundCloud 私密未发布歌曲 — TheMoonMidas · 2026-10-01
- 曝 Gemini 4 Argon token 效率不佳,早期口碑转冷 — adonis_singh · 2026-10-01
- Polymarket:谷歌年终领跑 AI 概率 40%,Gemini 4 Argon 曝百万 token 输出 — Polymarket · 2026-10-01
- 网友盘点 Opus 5.5 反复出现的「盖章」句式,称其为新 delve — dylfreed · 2026-10-01
- Pedro Domingos 断言:基于 token 的定价模式将很快过时 — pmddomingos · 2026-10-01
- ChatGPT 突发大规模宕机,大量用户无法使用 — Polymarket · 2026-10-01