16GB 显存跑 Swift 量化版:50 tps 实测后还能再压量化吗
royalflash417 · reddit · 2026-10-07
Reddit 用户分享在 16GB VRAM + 32GB RAM 本地跑 Swift 1.5 量化模型的经验:iq2xs 量化下平均生成速度约 50 tps(峰值 73 tps)、prefill 约 800 t/s。作者想进一步降低量化位宽以减少 KLD、提升 agentic coding 精度,向社区征集配置方案。
「模型」频道最新
- karminski 实测 Claude Opus 5.5:几分钟重构出工业级风扇监控面板 — karminski3 · 2026-10-07
- Reddit 用户察觉 ChatGPT 语气突变:回答明显更保守、不敢下判断 — sweetjale · 2026-10-07
- 每个结果仅耗 3 小时 ChatGPT Pro 思考量,研究者称令人震惊 — Dr_Atoosa · 2026-10-07
- Elliot Glazer:OpenAI 发布及格,但此前传闻几乎全被证伪 — ctjlewis · 2026-10-07
- 用本地模型自学量子力学遇瓶颈:小参数 Qwen 与 Ministral 撑不住物理推导 — Available_Pressure47 · 2026-10-07
- daniel_mac8:推理模型两年从算不了术到解数十年难题,数学界如遭核爆 — daniel_mac8 · 2026-10-07