AMD优化llama.cpp:减少MTP缓冲开销,上下文长度翻倍

ea_man · reddit · 2026-08-09

开发者eaman分享了对llama.cpp的补丁,通过减少MTP缓冲区的内存开销,显著提升了可用上下文长度。在ROCm和Vulkan后端上,Qwen 27B模型的上下文长度从64K提升至149K(双GPU配置)。补丁和测试日志已公开。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →