32GB 显存批量文本抽取实测:MoE 35B 预填充提速 40 倍

MkGod · reddit · 2026-09-14

作者用 2x RTX 5060 Ti(32GB 显存)做长文本结构化抽取:Qwen 27B Q4KM 约 50 t/s;换用 MoE 模型 Ornith-1.5-35B Q4 后预填充冲到约 2000 t/s,生成约 100-110 t/s。其工作负载以读长上下文、输出短结构化结果为主,预填充提升大幅缩短总耗时。

帖内同时求证:7B-14B 稠密模型做 schema 抽取是否够用、MoE 是否已是明显优选,以及是否有追踪本地推理实测速度(prefill/decode)的榜单。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →