呼吁建立基于任务耗时与吞吐量的本地模型榜单

BornInAFish · reddit · 2026-08-27

作者指出,目前的本地模型榜单大多只看准确率,忽略了推理延迟对实际体验的影响。对于 Agent 场景,用户更关心在限定时间(如午餐 30 分钟或整晚)内能完成多少任务。作者呼吁建立新的基准测试:在特定硬件和量化配置下,统计模型在单位时间内解决的问题数量,或至少在发布跑分时公布耗时,以便计算“效能/秒”。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →