回应基准测试:这可能是为了刷榜
sudoraohacker · x · 2026-08-18
Sudora Hacker 回复 Georgi Gerganov,表示他们即将广泛测试某项技术,但这可能只是为了最大化基准测试成绩(benchmaxxing)。
「模型」频道最新
- 传智谱 GLM-5.3 下周开源,基准推测 Frontier 已超线 — xeophon · 2026-08-18
- bondingAI 推出企业语言模型 xLLM,主打确定性 — granvilleDSC · 2026-08-18
- Gemini 3.7 Flash 规划提速 2-6 倍,具性价比工作流现身 — rakyll · 2026-08-18
- 新基准 MazeBench 揭露顶尖 Agent 难以通过基础 3D 关卡 — xeophon · 2026-08-18
- 有研究者断言:线性注意力是沉没成本谬误的产物 — jm_alexia · 2026-08-18
- 阿里轻量级 Qwen 评测匹敌 GPT-5.6 Luna — pstAsiatech · 2026-08-18