基准测试的猫腻:通过控制评测项目可得出任何预设结论
felix_red_panda · x · 2026-08-03
开发者 @felixredpanda 对近期某项模型评测提出尖锐批评。他指出,只要精心挑选和控制基准测试的具体项目,就能得出任何想要的结论。此外,他还吐槽了该评测在处理单批次请求时的 token 吞吐量与成本效益极其不合理。
所属事件:专家质疑大模型评测:挑选指标即可得出任意结论(2 条相关)→
「模型」频道最新
- 实测 Qwen3.8-Max:开源模型在 Agent 任务已逼近闭源前沿 — dair_ai · 2026-08-04
- 推测 Kimi K3 达 2.8T 参数,或由更小的 Opus 蒸馏 — gabriberton · 2026-08-04
- 实测吐槽:Claude 3.5 Sonnet 与 Opus 做幻灯片效果极差 — nathanbenaich · 2026-08-04
- Kimi K3 架构解析:如何突破 MoE 规模极限 — AndLukyane · 2026-08-04
- EpochAI 更新 MirrorCode 榜单,Claude 3.5 Sonnet 登顶 — xeophon · 2026-08-04
- OpenAI与Anthropic延迟发布,是为防开源追赶? — 0xsachi · 2026-08-04