5060 Ti 16GB 跑 Qwen3.8 Flash Next IQ1_M:55 tok/s 还能写出像样落地页
bobaburger · reddit · 2026-10-07
- 作者在 5060 Ti 16GB + 32GB 内存的低配机器上实测 qwen3.8-flash-next-coder-iq1m,配置 nctx=65k
- 平均 prompt 处理 1.5k tok/s,生成速度 55 tok/s
- IQ1M 极限量化下质量意外能打:一次性 prompt 生成落地页约 2 分钟(46 tok/s),效果不输以往本地 Q3 模型,甚至比一些前沿模型的「Claude 风」更合口味
- 又测了交互式 3D 地球仪:首版 8 分钟,再花 1 分钟修 JS 错误,结果依然可圈可点
- 两个 demo 在线可看:bakery 与 earth 页面
「Infra」频道最新
- NVIDIA 直播演示 DGX Spark 混合 AI 智能路由方案 — NVIDIAAI · 2026-10-07
- DGX Station 外接一张 RTX Pro 6K:DeepSeek V4.1 Flash 预填冲上 6 万 tok/s — Sentdex · 2026-10-07
- Hugging Face 工程师演讲:llama.cpp 与本地 AI 推理生态全景 — unofficialmerve · 2026-10-07
- 谷歌签 20 年核电大单,Constellation 股价单日暴涨 14% — Polymarket · 2026-10-07
- 互联网根密钥 10 月 11 日换签,Cloudflare 详解 DNSSEC KSL 轮换与检测方法 — Cloudflare Blog · 2026-10-07
- 16GB RTX 5080 跑 Qwen 3.8 27B:NInfer 调优后解码 96 t/s、11 万上下文 — Kernoriordan · 2026-10-07