ISTA 实验室实验:prefill/decode 分开量化,27B 模型 GGUF 压到 13.7GB
victormustar · x · 2026-09-21
ISTA-DASLab 发布了一个实验性项目 Qwen3.8-27B-disaggregated-NVFP4-prefill,思路是 prefill 与 decode 瓶颈不同,不必用同一种量化格式:
- Prefill 用 NVFP4,适合快速低精度矩阵运算;
- Decode 用更紧凑的表示(IQ1IQ2 量化),降低显存带宽压力;
- 按需加载 prefill 表示,而非在 GPU 显存中保留两份完整模型;
- 该 24B 参数模型 GGUF 总体积约 13.7GB。
注意仍是实验阶段:HF 仓库无模型卡,使用自定义 odp 架构,不能直接在现有运行时当普通 GGUF 用。
「Infra」频道最新
- 爆料称 NVIDIA 下一代游戏 GPU 或推迟到 2028 年 — mark_k · 2026-09-21
- AMD 显卡 ComfyUI 跑 Minimax H3:本地生成 1080p 视频全流程 — mwhjose · 2026-09-21
- 用量限额让定时 Agent 任务集体停摆 19 小时,团队复盘出四条防呆改造 — lilythemoon54 · 2026-09-21
- 开发者呼吁:避免 cache miss 或是提升 Claude Code/Codex 用量上限最关键一招 — chaseleantj · 2026-09-21
- Reddit 实操讨论:生产环境如何测试 LLM 提供商故障 — Rama_Surasani_ · 2026-09-21
- 本地跑 Flux 2 Dev 全攻略:30B 模型配显存方案与模型组合玩法 — Altruistic_Heat_9531 · 2026-09-21