呼吁建立基于任务耗时与吞吐量的本地模型榜单
BornInAFish · reddit · 2026-08-27
作者指出,目前的本地模型榜单大多只看准确率,忽略了推理延迟对实际体验的影响。对于 Agent 场景,用户更关心在限定时间(如午餐 30 分钟或整晚)内能完成多少任务。作者呼吁建立新的基准测试:在特定硬件和量化配置下,统计模型在单位时间内解决的问题数量,或至少在发布跑分时公布耗时,以便计算“效能/秒”。
「模型」频道最新
- 社区开源 Claude Mythos 理论复现架构 — Shruti_0810 · 2026-08-27
- Z.ai 曝光 Ox Alpha 架构与国产算力底座 — rohanpaul_ai · 2026-08-27
- Anthropic Opus 5 被吐槽无法理解“简短” — PtrPomorski · 2026-08-27
- Llama-3-8B 在规划基准测试中准确率跃升至 94% — mdancho84 · 2026-08-27
- 腾讯开源 WeMM-Embedding-9B,多模态嵌入模型登 HF 热榜 — tencent · 2026-08-27
- DeepSeek V4 与 Qwen 3.8 混部实测对比 — Legitimate_Hat_7852 · 2026-08-27