研究者质疑某基准评测数据:新模型反不如旧一代
BlackHC · x · 2026-10-01
研究者 BlackHC 公开质疑某基准(疑似 Meta 相关)的评测成绩:按常理新一代模型应优于旧代,但榜单上完全不体现这一趋势,且其他分数也有异常。他追问该基准整体评测数据到底出了什么问题,暗指评测口径或数据可能存在猫腻。
所属事件:研究者质疑某基准评测数据异常:新模型竟不及旧一代(2 条相关)→
「模型」频道最新
- 曝 Gemini 4 Argon token 效率不佳,早期口碑转冷 — adonis_singh · 2026-10-01
- Polymarket:谷歌年终领跑 AI 概率 40%,Gemini 4 Argon 曝百万 token 输出 — Polymarket · 2026-10-01
- 网友盘点 Opus 5.5 反复出现的「盖章」句式,称其为新 delve — dylfreed · 2026-10-01
- Pedro Domingos 断言:基于 token 的定价模式将很快过时 — pmddomingos · 2026-10-01
- ChatGPT 突发大规模宕机,大量用户无法使用 — Polymarket · 2026-10-01
- 用户吐槽 Google 新模型发布节奏:先内测再 $200 门槛 — zacharynado · 2026-10-01