开发者推出 BetterBench:更精准的 LLM 性能基准测试

whodoneit1 · reddit · 2026-08-06

独立开发者推出了 BetterBench 测试工具,旨在解决现有基准测试因使用随机数据而导致结果不准确的问题。在 MTP(多 token 预测)场景下,不同内容类型会带来 5% 甚至更大的性能表现差异。

该工具将不同内容类型间的性能一致性控制在 1% 以内,并支持跨多种内容类型的测量。作者还展示了在双 R9700 上运行 Qwen3.6 27B FP8 的实测结果。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →