Matryoshka 嵌套模型套件省36%算力,作者反讽审稿机制

Yoav Artzi 与 Nathan Godey 发布论文 Matryoshka Language Model Suites(arXiv:2608.09703),通过嵌套训练模型套件节省约 36% 算力,并借投机解码实现约 26% 提速。Artzi 同时以反讽口吻模拟审稿人语气调侃:模型都用万亿 token 训练了,谁还看 PPL 困惑度指标,讽刺当前审稿过度迷信规模与算力。

2026-09-25 ~ 2026-09-25 · 2 条相关