推理并发越低模型越聪明?聊聊量化与GEMV的玄学猜想
karminski3 · x · 2026-09-17
一个有趣的猜测:如果模型完全空闲(并发为1、只有一个请求),在极端量化下走 GEMV 而非 GEMM 的计算路径,累计精度损失更低,模型可能会显得更聪明。这是对推理服务负载与量化精度关系的技术性闲聊,属于未经验证的猜想。
「Infra」频道最新
- Rust+Vulkan 原生训练后端,支持 143 种 Transformer 架构 — PhysicsDisastrous462 · 2026-09-17
- 双 RTX Pro 本地推理实测:解码 150 tok/s、预填充 10K tok/s — No_Run8812 · 2026-09-17
- Rust+Vulkan 实现训练后端,覆盖 143 种 Transformer 架构 — PhysicsDisastrous462 · 2026-09-17
- GPU 价格仍在上涨,算力供不应求成行业共识 — firstadopter · 2026-09-17
- Guardian:十大 PFAS 厂商几乎全部扩产,为满足 AI 芯片与数据中心冷却需求 — jathansadowski · 2026-09-17
- 孟菲斯大学研究:xAI Colossus 1 运营一年周边空气未见明显恶化 — TinfoilTricorn · 2026-09-17