极限优化:在 M4 芯片 ANE 上运行 33B 视频生成模型
antirez · x · 2026-08-13
开发者 @originalmaderix 基于 @antirez 的 MiniMax H3 视频生成实现,成功将其移植到 Apple Neural Engine (ANE) 上运行,挑战在 M4 芯片上跑通 33B 参数的大模型。
该硬核优化项目采用了 SSD 流式传输技术,并将 int8 计算重叠在 ANE 上执行。令人印象深刻的是,运行这个庞大的 Diffusion Transformer 模型时,峰值内存占用仅约为 2GB,且功耗控制在 5W 以内。
「Infra」频道最新
- Lumentum CEO:单两大AI数据中心带宽需求翻倍过去十年总和 — Beth_Kindig · 2026-08-13
- 为何本地模型无法赢得未来?算力与成本双重劣势注定云端胜出 — rseroter · 2026-08-13
- 智能体工程的三层进阶:真正的瓶颈是算力而非大模型 — peterjliu · 2026-08-13
- RTX 5060 Ti 16G 本地跑图实测:8 步生成超 2300 分辨率图像 — Sad_Coach_1433 · 2026-08-13
- 分析师警告 AI 数据中心容量危机:算力扩张正撞上电网瓶颈 — DavidLinthicum · 2026-08-13
- SkyPilot 新功能:统一调度多 Slurm 集群,解决 GPU 管理瓶颈 — skypilot_org · 2026-08-13