Matryoshka 嵌套模型套件省36%算力,作者反讽审稿机制
Yoav Artzi 与 Nathan Godey 发布论文 Matryoshka Language Model Suites(arXiv:2608.09703),通过嵌套训练模型套件节省约 36% 算力,并借投机解码实现约 26% 提速。Artzi 同时以反讽口吻模拟审稿人语气调侃:模型都用万亿 token 训练了,谁还看 PPL 困惑度指标,讽刺当前审稿过度迷信规模与算力。
2026-09-25 ~ 2026-09-25 · 2 条相关
- 审稿人吐槽研究:模型都用万亿 token 训了,谁还看 PPL — yoavartzi · 2026-09-25
- Matryoshka 论文:嵌套训练模型套件省 36% 算力,投机解码提速 26% — yoavartzi · 2026-09-25