腾讯HY3模型128GB Mac本地部署实测
returnity · reddit · 2026-07-11
一位开发者在 128GB 内存的 Mac Studio 上成功部署了腾讯最新开源的 HY3 模型(295B-A21B MoE),并分享了详细的配置过程与性能表现。
- 部署细节:选用了社区提供的 107GB 动态 2-bit 量化版本(UD128)。通过拉取 llama.cpp 特定分支并修改 GGUF 文件中的架构标识符,成功在 Metal 框架下运行。
- 性能表现:在 16K 上下文环境下,预填充速度达 124 tokens/s,生成速度为 16.3 tokens/s。
- 使用体验:实际生成速度相比此前运行 DeepSeek V4 Flash 翻倍,且输出质量相当或更优。初步测试显示其在常规提示和基础工具调用上表现优异。
- 后续计划:作者计划进一步测试多 token 预测(MTP)加速以及更长周期的复杂编码任务。
所属事件:腾讯HY3大模型在128GB Mac成功本地部署(2 条相关)→
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11