本地跑什么基准才有用?Reddit 讨论自建推理评测体系

JustTooKrul · reddit · 2026-09-17

一位本地部署用户在 r/LocalLLaMA 发帖求教:想在本地搭建可复现的评测体系,测量 KV cache 量化(BF16→Q8)带来的质量损失、不同 MTP/draft 模型的投机解码性能、以及不同 chat template 下的 tool calling 表现(还吐槽了 Qwen 3 早期工具调用翻车史)。

他偏好确定性基准(避免 LLM-as-judge 引入额外误差)和支持长上下文测试的项目,目前已实现 MMLU-Pro、GPQA-Diamond、BCFL v4 和 RULER,计划加入 LiveCodeBench、Terminal-Bench 和 PlanBench,重点考察编码与 agent 能力。他担心这套东西过度设计,或者跑出来只能反映模型整体质量、测不出不同 vLLM/llama.cpp 配置间的真实差异,于是向社区征集大家实际在跑什么、哪些真正有用。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →