极限优化:在 M4 芯片 ANE 上运行 33B 视频生成模型

antirez · x · 2026-08-13

开发者 @originalmaderix 基于 @antirez 的 MiniMax H3 视频生成实现,成功将其移植到 Apple Neural Engine (ANE) 上运行,挑战在 M4 芯片上跑通 33B 参数的大模型。

该硬核优化项目采用了 SSD 流式传输技术,并将 int8 计算重叠在 ANE 上执行。令人印象深刻的是,运行这个庞大的 Diffusion Transformer 模型时,峰值内存占用仅约为 2GB,且功耗控制在 5W 以内。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →