同权重不同栈即变笨:10万token实测本地LLM翻车根源
量子位 · wechat · 2026-08-29
Level1Techs 用户 thr3e 做了一系列严谨实验:用 Qwen3.6-27B 在 RTX PRO 6000 Blackwell 上完成超 10 万 token 的全量 logit 捕获测试,解释了为什么本地部署的大模型常常比官方版更笨。
- 注意力后端差异:仅切换 vLLM 的 FlashAttention2 / FlashInference / TritonAttention 后端,其余全部不变,长上下文中就出现 Top-1 翻转。实测一例:工具调用目标接口 GigabitEthernet0/0/1.201 被写错,后续两次调用跟着出错。同后端多次运行则逐位一致,说明分歧完全来自不同 CUDA 核的数值差异。
- KV 缓存量化:BF16 全程稳定;INT8 出错后能恢复;INT4 在长上下文中翻转率急剧攀升,工具调用彻底失败——专坑为省显存压 KV 缓存的用户。
- 权重量化横评:社区版 INT8(W8A16、无校准)一致性碾压 Qwen 官方 FP8 和英伟达 NVFP4;NVFP4 最差,88k 上下文时 Top-1 翻转率近 50%,实际工具调用也未正确关闭。
- 张量并行诡异现象:同一 BF16 权重 TP1 成功、TP2 失败、TP4 又成功,源于 NCCL 跨卡归约的数值差异。
作者还提醒:vLLM nightly 容器含 734 个依赖包,HuggingFace 模型卡上的低 KL 散度数字在披露不完整时不可轻信。测试工具与数据集正在打包成可分发版本。
「Infra」频道最新
- 实拍搭建小型本地 AI 集群的体验 — BLUECOW009 · 2026-08-29
- 摩尔线程 MTT S5000 首日支持智谱 GLM-5.3-Flash — teortaxesTex · 2026-08-29
- Lightning AI 云平台上线 H200 与虚拟机服务 — LightningAI · 2026-08-29
- 博主反驳数据中心挤占居民用水论:美国无一例实证 — AndyMasley · 2026-08-29
- 数据中心民调反转: Voters 先支持禁建,谈钱后倒戈 — Polymarket · 2026-08-29
- AI数据中心缺电困局:燃料电池成“时间换电力”解法 — tengyanAI · 2026-08-29