AMD 7900 XTX 本地跑 Qwen3.8 Flash-Next:500k 上下文 105-160 tok/s
human_in_the_looop · reddit · 2026-10-12
作者在 AMD 7900 XTX 上本地运行 Qwen3.8-Flash-Next(176B 总参数、6B 激活的 MoE),实现 50 万上下文日常使用。要点:- 权重共 66.4GB:23.8GiB 常驻显存 + 31.6GB 专家权重 + 28.8GB PLE 表放系统内存;- 解码速度 105-160 tok/s,实测上下文撑到 506,849 tokens;- 质量(4k/64k/256k 测试)thinking 关 81-84%、开 88-94%,无截断,深度增加解码仅降 18% 而质量不降;- 排查了一个重要坑:preservethinking: true 会把先前推理喂回每次 prompt,约 13000 轮中出现 266 次「自我回声」复读,且回声在上下文中复制越多越容易再触发;移除后问题消失。作者称这已成为日常主力,比 llama.cpp 和 Swift 1.5 27b dense 大幅进步,完整记录见其博客。
「Infra」频道最新
- 工程师晒入职满月动态:加入英伟达做 Groq LPU 编译器 — blelbach · 2026-10-12
- Linus Ekenstam 立目标:要在手机上跑千亿参数模型 — LinusEkenstam · 2026-10-12
- Brookings:AI 建设融资十年将耗 10.3 万亿美元,占 GDP 3.63% — KyeGomezB · 2026-10-12
- Fireworks 实战:开源模型加微调可追平闭源,Cursor 推理快 13 倍 — AI Engineer · 2026-10-12
- 456GB 大模型塞进 192GB 显存:混合 offload 推理实测跑通 — HankYeomans · 2026-10-12
- VitalOps 上线:智能体自动优化推理栈,实测提速 2.6 倍 — abhijithneil · 2026-10-12