halogen 0.12.0 让 Strix Halo 跑百万上下文解码提速至 38 tok/s
peonist-ai · reddit · 2026-09-20
peonist-ai 发布 halogen-flash-server 0.12.0,修复了长上下文下性能退化的问题,在 AMD Ryzen AI Max+ 395(128GB,Strix Halo)上跑 Qwen3.8-Flash-Next 的 100 万上下文实测。
- 100 万 token 上下文解码速度从 27.3 提到 38.3 tok/s(默认投机草稿);258,794 上下文从 42.9 到 45.0 tok/s
- 百万上下文预填充从 790 提到 937 tok/s,冷请求耗时从 21.2 分钟降到 17.9 分钟;256k 预填充 1,086→1,114 tok/s
- 命中 prompt cache 的后续轮次 100 万上下文首 token 约 0.55 秒
- 配置方法:在 podman 命令加 HALOGENROPEYARN=4 和 HALOGENCTX=1048576,需 128GB 内存的机器;代码与完整数据表开源在 GitHub
「Infra」频道最新
- 单张 RTX 5090 跑 Qwen3.8 Flash Next:靠 expert caching 达 50 t/s — dir3ctly · 2026-09-20
- 数据中心真的没交税?Tax Foundation 数据给出各地税率对比 — AndyMasley · 2026-09-20
- AMD 为 Kimi-K3 做重磅软件优化,国产模型硬件适配提速 — AccBalanced · 2026-09-20
- 内存价格半年从350涨到640美元,个人换机越来越难 — chrisalbon · 2026-09-20
- NVIDIA 工程师详解 DeepSeek V4.1 Flash 为速度重构架构 — thursdai_pod · 2026-09-20
- 140 美元捡漏 AMD MI50:老平台加卡跑 30B 模型提速近 9 倍 — tabletuser_blogspot · 2026-09-20