换一个 attention 节点,AMD iGPU 本地跑 MiniMax-H3 提速 2.5 倍

ShamanFlamingoFR · reddit · 2026-09-21

作者在三周前于 Ryzen AI Max+ 395(Radeon 8060S iGPU,128GB 统一内存)上本地运行 MiniMax-H3 视频生成后跟进:同样机器、同样图、同样模型,单次评测耗时从 45.7 秒降到 18.3 秒,端到端冷启动从 521 秒降到 206 秒,提速关键不是量化或 flag,而是一个 attention 节点终于有了对应内核。

核心做法

其他进展

结论修正:时钟和权重不变的情况下,仅换 attention 实现就拿到 2.5 倍加速,说明此前的「带宽瓶颈」结论需要修正——瓶颈其实是 split attention 分块计算在 VRAM 里往返中间结果产生的额外流量,融合 INT8 内核消除了它。三段式 15 秒片段整链渲染从 31 分 40 秒缩至 13 分 11 秒(×2.4)。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →