专家质疑大模型基准测试:精心挑选指标即可得出任意结论

felix_red_panda · x · 2026-08-03

针对近期的大模型基准测试结果,Felix 指出这是一个典型的“通过精确控制评测基准来得出任意结论”的案例。

他特别批评了在 batch size 为 1 时的 tok/sec/$(每秒每美元 token 数)指标表现十分荒谬:测试方在表面上声称不关心成本,但在实际对比中却只挑选了次优的方案来展示。

所属事件:专家质疑大模型评测:挑选指标即可得出任意结论(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →