gfx906 fork 让 MI50 等老卡跑 LLM:预填充提速 23%,40GB 塞下 250k 上下文
milpster · reddit · 2026-09-05
开发者 milpster 发布 gfx906-llama-cpp fork 的更新,针对 MI50/MI60/Radeon VII 等 AMD GCN 架构老显卡大幅优化:
- prefill PP16384 从 332.5 t/s 提升到约 410 t/s,+23%
- 120k deep fill +14%,TG 解码 +11%(约 15.1 t/s)
- 40GB 显存可 tight-fit 塞下 250k 上下文(上游无法容纳)
- 输出与上游 bit-identical(sha 与 token 逐 token 一致)
改进主要来自吸收上游 llama.cpp 的相关 PR。作者还表示这个 fork 是用 AI 辅助开发的。对想用廉价老卡本地跑大模型的用户是实用资源。
「Infra」频道最新
- 开发者实测 NVIDIA 版 Deepseek V4 NVFP4:1M 上下文下显存占用 96% — HankYeomans · 2026-09-05
- 用 500 美元的 16GB 显存 GPU 也能拍电影 — francoisfleuret · 2026-09-05
- Minima 将 Qwen3.8-27B 全部 496 层量化至 NVFP4 W4A4,体积缩 2.9 倍 — pbaylies · 2026-09-05
- 19 个延迟优化模式:模型之外的 AI 应用提速路线图 — bibryam · 2026-09-05
- 曝 OpenAI Astra 动用 10 万枚 GPU 训练,算力规模惊人 — sudoraohacker · 2026-09-05
- 爆料称 GPT-6 仅用 10 万块 B200/300 在德州单基地训练完成 — round · 2026-09-05