32GB 显存批量文本抽取实测:MoE 35B 预填充提速 40 倍
MkGod · reddit · 2026-09-14
作者用 2x RTX 5060 Ti(32GB 显存)做长文本结构化抽取:Qwen 27B Q4KM 约 50 t/s;换用 MoE 模型 Ornith-1.5-35B Q4 后预填充冲到约 2000 t/s,生成约 100-110 t/s。其工作负载以读长上下文、输出短结构化结果为主,预填充提升大幅缩短总耗时。
帖内同时求证:7B-14B 稠密模型做 schema 抽取是否够用、MoE 是否已是明显优选,以及是否有追踪本地推理实测速度(prefill/decode)的榜单。
「Infra」频道最新
- 人类攻击者 8 秒打穿 Marimo 漏洞并横移至 SSH 堡垒机 — ChuckDBrooks · 2026-09-15
- Neocloud 大战拉开:AI 算力基建正分化为四大类玩家 — DavidLinthicum · 2026-09-15
- 推理工程入门路线:Docker 里跑 vLLM 实测 TTFT 与吞吐 — malliktwts · 2026-09-15
- MinIO:兼容 S3 API 的开源对象存储,彻底免掉数据出口费 — thisdudelikesAI · 2026-09-15
- NVIDIA 官宣 GTC 华盛顿站:2026 年 12 月 1 日黄仁勋主题演讲 — nvidia · 2026-09-15
- 民调:61% 美国人反对建 AI 数据中心,年轻人反对最烈 — justin_hart · 2026-09-15