突破虚拟化限制,Apple Silicon 跑 LLM 推理提速 16 倍
petrusenko_max · x · 2026-08-12
开发者在 Apple Silicon macOS 虚拟机(VM)内引入了一个自定义兼容层,通过调用更新的 Metal GPU 内核,大幅提升了 llama.cpp 的本地大模型推理速度。
测试显示,推理速度最高提升了 11 至 16 倍。在 M1 Ultra 芯片上运行 TinyLlama 模型时,其提示词处理速度达到了裸机运行水平的 98%。
「Infra」频道最新
- Mistral 宣布推区域推理与欧洲算力单元,首发支持第三方模型 — sophiamyang · 2026-08-12
- 美国某州或出台数据中心禁令,预测市场概率达73% — Polymarket · 2026-08-12
- 华盛顿小镇因 AI 数据中心迎来经济奇迹:脱贫与基建翻新 — Polymarket · 2026-08-12
- RTX 5090跑MiniMax视频生成,15秒成本仅0.06美元? — breath_mirror · 2026-08-12
- 本地AI算力被浪费?开发者呼吁模型原生支持并行任务 — FaithlessnessFar6431 · 2026-08-12
- NVIDIA 发布在 DGX Station 本地运行 Nemotron 3 Ultra 教程 — NVIDIAAI · 2026-08-12