修复 MTP 头,Ornith1.5 35B 推理耗时降 33%

frankentriple · reddit · 2026-08-22

作者通过将训练好的 MTP (Multi-Token Prediction) 头移植到 Ornith1.5 35B 的 APEX 量化版本上,修复了原版未训练头的问题。优化后的模型在相同任务下,虽然每秒生成 Token 数 (TPS) 仅从 60 提升至 64 (+6.7%),但端到端完成时间减少了 33% (从 21 秒降至 14 秒),显著提升了推理效率。作者已将模型发布至 Ollama,并公开了测试方法与结果数据。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →