Ornith-1.5 配套 DFlash 草稿模型上线,最高 2.54 倍无损加速
alan_ritter · x · 2026-10-01
Ornith-1.5 全系(9B、35B-A3B、397B)现配套发布 DFlash draft models,已上架 Hugging Face 的 Ornith-1.5-DFlash 合集(草稿模型参数量分别为 1B、0.4B、1B)。
工作原理是投机解码(speculative decoding):DFlash 作为草稿模型一次起草多个 token,Ornith-1.5 再单次验证这些草稿 token,替代逐 token 生成。官方性能评估显示最高可达 2.54× 推理加速,且生成质量无损。用户可直接接入本地工作站使用。
所属事件:Ornith-1.5 全系开源 DFlash 草稿模型,最高 2.54 倍无损加速(2 条相关)→
「Infra」频道最新
- 巴拉圭将建120亿美元AI城,规划拉美最大超大规模数据中心 — teortaxesTex · 2026-10-01
- You.com 携手 NVIDIA 把实时搜索引入 RL 训练,首个用于 Nemotron 3.5 Lightning — RichardSocher · 2026-10-01
- 零填充让 vLLM 跑 tp=6:6 卡跑 27B 模型实测 50 tok/s — Biomass23 · 2026-10-01
- 为省推理成本,Bittensor Chutes 团队或发现全新模型训练方式 — markjeffrey · 2026-10-01
- 经理锁死 Teams 会议记录,员工借 Copilot 从源码里捞回转录 — TheBigCrowbroski · 2026-10-01
- 算力横向对比:Nvidia 仍是性价比最优硬件 — Storge2 · 2026-10-01