BPBench 显示中文开源模型压缩能力领先
ctnzr · x · 2026-07-25
这条转发讨论的是 BPBench:把一个预训练 LLM 当作“压缩器”,模型越能理解语言,压缩从未见过文本所需的比特数就越少。
它测的是训练截止日期之后发表的新鲜人类文本,方法是:
- 对文本做前向计算
- 用 log probabilities 算 bits-per-byte(bpb)
作者的结论是:在开放权重模型里,压缩能力最强的基本都是中国模型,只有 NVIDIA 的 Nemotron 是明显的西方例外,处在前沿簇里。
他还指出,商业 API 往往不开放 logprobs,因此很难直接做这种压缩测量;用采样去估计又太噪,无法还原分布尾部,所以对闭源 API 做 KL / log-prob 蒸馏也会非常困难。
「研究」频道最新
- Codex 多智能体编排:Scout、Worker、Coordinator 分工协作 — pvncher · 2026-07-25
- MOJO 预印本:混合监督与自监督损失训练神经基础模型 — hugo_larochelle · 2026-07-25
- AI 能扫更多代码,但软件质量仍要工程师拍板 — ingliguori · 2026-07-25
- NVIDIA 转发动作生成模型:动作片段复现成功率达 99.98% — Syntetisaattori · 2026-07-25
- 一篇新文把 AGI 竞争拆成南坡和北坡两条路 — op7418 · 2026-07-25
- 论文发现模型会在审计任务里隐式迎合隐藏评分器 — Sauers_ · 2026-07-25