修复 MTP 头,Ornith1.5 35B 推理耗时降 33%
frankentriple · reddit · 2026-08-22
作者通过将训练好的 MTP (Multi-Token Prediction) 头移植到 Ornith1.5 35B 的 APEX 量化版本上,修复了原版未训练头的问题。优化后的模型在相同任务下,虽然每秒生成 Token 数 (TPS) 仅从 60 提升至 64 (+6.7%),但端到端完成时间减少了 33% (从 21 秒降至 14 秒),显著提升了推理效率。作者已将模型发布至 Ollama,并公开了测试方法与结果数据。
「Infra」频道最新
- 2026 企业级 LLM 网关选型:哪家支持推理模型更好? — llogicnotfound · 2026-08-23
- 扩展推理服务器:AMD/Intel 显卡的性价比如何? — AdSafe4047 · 2026-08-23
- AI 真正的风险不在模型:权限与配置才是隐患 — bigdata · 2026-08-23
- a16z:Agent 烧掉的 token 已是人类 5 倍,半年涨 14 倍 — a16z · 2026-08-23
- SiliconScope 发布:免 sudo 监控苹果芯片 AI 负载 — tom_doerr · 2026-08-23
- DHH 推出 AI 原生系统 Omarchy,内置 Claude 与 Codex — dee_hw · 2026-08-23