博主质疑:3 小时数据或是精心挑选的评测成绩
RexDouglass · x · 2026-10-09
有博主指出,在官方只发布选择性指标的情况下,某模型「3 小时」的评测数据很可能是极端挑选过的:例如同一个问题跑 100 次只报告成功案例,或在不同版本模型上反复尝试后择优公布。作者提醒读者对这类未公开完整方法的评测结果保持怀疑。
「模型」频道最新
- Anthropic 新规:虐待 Claude 将违反使用政策,引模型福利争论 — AlexTensor · 2026-10-09
- Codex 被限速至 5 tok/s,博主称本地模型部署才是正解 — lxfater · 2026-10-09
- 博主批评 OpenAI 数学成果"先宣布后评审",流程本末倒置 — JFPuget · 2026-10-09
- Anthropic 收紧措辞限制,网友调侃 AI 迎来「DEI 时代」 — CtrlAltDwayne · 2026-10-09
- 换算单价后 Claude Pro 的 Opus 订阅竟与 DeepSeek Flash 同价 — teortaxesTex · 2026-10-09
- DeepSeek 在 OpenRouter 的 Token 用量超过四大巨头总和 — FinanceYF5 · 2026-10-09