MLX-VLM 支持 Qwen4 模型 PLE 表磁盘卸载
EyalToledano · x · 2026-08-29
MLX-VLM 项目合并了一个新 PR,为 Qwen4exp 模型增加了 pleondisk 选项。该功能允许将 n-gram PLE(Per-Layer Embedding)表保留在磁盘上,按需读取和解量化,而不是常驻内存。这类似于现有的 MoE 卸载机制,旨在减少内存占用,适用于权重结构庞大但大部分时间处于冷状态的模型,从而优化推理性能。
「Infra」频道最新
- 德国警告 AI 算力不足,计划 2030 年算力翻四倍 — Polymarket · 2026-08-29
- WaveZip 推出:号称将芯片仿真存储成本降低 100 倍 — ycombinator · 2026-08-29
- QuixiAI 开源高性能推理服务 SlimServe — QuixiAI · 2026-08-29
- Ollama 新增 Claude 开关:本地模型可直接接入 Claude Desktop — dr_cintas · 2026-08-29
- AI 数据中心遭遇实体阻力,基础设施 backlash 升级 — AccBalanced · 2026-08-29
- 单卡 DGX Spark 运行 Qwen 3.8 MoE 实测方案 — QuixiAI · 2026-08-29