BPBench 显示中文开源模型压缩能力领先

ctnzr · x · 2026-07-25

这条转发讨论的是 BPBench:把一个预训练 LLM 当作“压缩器”,模型越能理解语言,压缩从未见过文本所需的比特数就越少。

它测的是训练截止日期之后发表的新鲜人类文本,方法是:

作者的结论是:在开放权重模型里,压缩能力最强的基本都是中国模型,只有 NVIDIA 的 Nemotron 是明显的西方例外,处在前沿簇里。

他还指出,商业 API 往往不开放 logprobs,因此很难直接做这种压缩测量;用采样去估计又太噪,无法还原分布尾部,所以对闭源 API 做 KL / log-prob 蒸馏也会非常困难。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →