AMD优化llama.cpp:减少MTP缓冲开销,上下文长度翻倍
ea_man · reddit · 2026-08-09
开发者eaman分享了对llama.cpp的补丁,通过减少MTP缓冲区的内存开销,显著提升了可用上下文长度。在ROCm和Vulkan后端上,Qwen 27B模型的上下文长度从64K提升至149K(双GPU配置)。补丁和测试日志已公开。
「Infra」频道最新
- LeCun 辩 AI 算力战:突破性芯片常因软件匮乏而失败 — ylecun · 2026-08-09
- 高通 GenieX 实操:在骁龙设备用 NPU 跑大模型 — carrycooldude · 2026-08-09
- AI 算力代价:英国数据中心扩张正引发水资源与电力危机 — nordicinst · 2026-08-09
- 开发者制作 MiniMax H3 RunPod 一键部署模板 — Draufgaenger · 2026-08-09
- 亚马逊自建巨型燃气电厂,或成全美最大气候污染源 — Nunki08 · 2026-08-09
- 北大等提出 UltraEP:突破大规模 MoE 训练 GPU 负载瓶颈 — jiqizhixin · 2026-08-09