回怼「Gemini 4 登顶论」:LMArena 被批是垃圾基准
zephyr_z9 · x · 2026-10-04
zephyrz9 回应 blondesnmoney 关于 Gemini 4 Argon 登顶多个榜单的说法,直斥 arena(即 LMArena)是个「slop benchmark」(垃圾基准),言下之意是该榜单排名不能反映真实模型质量;随后又甩出截图称 Google 目前实际上稳居第三,试图用另一份数据反驳登顶论。这是 AI 圈围绕基准可信度的典型争论。
所属事件:Gemini 4 Argon 多榜单登顶引热议 遭质疑基准可信度(3 条相关)→
「模型」频道最新
- 本地开源模型的乐趣:能看见自回归反馈伪影,拆穿模型魔术 — adariostrange · 2026-10-04
- 用户称 Opus 反驳「工匠自豪感重于原创性」的猜测 — repligate · 2026-10-04
- 开发者实测:Grok Bot 稳定性胜出,成主力编排 Agent — alexcovo_eth · 2026-10-04
- RWKV-7 G1k 发布:纯 RNN 无 KV cache,13B 推理仅靠 16M 状态 — cephaloform · 2026-10-04
- Sol 太省 token,用户考虑从 100 美元档降级 — DesiGrit · 2026-10-04
- 曝 Anthropic 前沿模型对动机机制解释「装傻」,自我审查倾向明显 — repligate · 2026-10-04