MLX-VLM 支持 Qwen4 模型 PLE 表磁盘卸载

EyalToledano · x · 2026-08-29

MLX-VLM 项目合并了一个新 PR,为 Qwen4exp 模型增加了 pleondisk 选项。该功能允许将 n-gram PLE(Per-Layer Embedding)表保留在磁盘上,按需读取和解量化,而不是常驻内存。这类似于现有的 MoE 卸载机制,旨在减少内存占用,适用于权重结构庞大但大部分时间处于冷状态的模型,从而优化推理性能。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →