本地跑什么基准才有用?Reddit 讨论自建推理评测体系
JustTooKrul · reddit · 2026-09-17
一位本地部署用户在 r/LocalLLaMA 发帖求教:想在本地搭建可复现的评测体系,测量 KV cache 量化(BF16→Q8)带来的质量损失、不同 MTP/draft 模型的投机解码性能、以及不同 chat template 下的 tool calling 表现(还吐槽了 Qwen 3 早期工具调用翻车史)。
他偏好确定性基准(避免 LLM-as-judge 引入额外误差)和支持长上下文测试的项目,目前已实现 MMLU-Pro、GPQA-Diamond、BCFL v4 和 RULER,计划加入 LiveCodeBench、Terminal-Bench 和 PlanBench,重点考察编码与 agent 能力。他担心这套东西过度设计,或者跑出来只能反映模型整体质量、测不出不同 vLLM/llama.cpp 配置间的真实差异,于是向社区征集大家实际在跑什么、哪些真正有用。
「编程与Agent」频道最新
- 不到 8 个月:AI 从陪写简单功能到独立构建服务百万用户的大型应用 — reach_vb · 2026-09-17
- 安全研究员披露 Google Antigravity 0day:DNS rebinding 打穿 AI Agent 拿 RCE — evilsocket · 2026-09-17
- Paper2Agent 登 Nature:把论文变成会答问、能协作的虚拟作者 agent — james_y_zou · 2026-09-17
- 省额度妙招:Astra 写计划、Luna 执行,定时巡检防跑偏 — TheMoonMidas · 2026-09-17
- 内部推理网关难管 MCP 与配置,开发者开源 blue 项目求解 — Educational-Hold9425 · 2026-09-17
- Kimi K2.7 纯 RL 训练逆袭:小模型跑分超 GPT-5.6 与自家 K3 — echen · 2026-09-17