DeepSeek V4 Flash 压缩至 57GB 并成功编写编译器
hacklas · hn · 2026-08-17
开发者将 DeepSeek V4 Flash 0731(原 284B 参数)压缩至 57GB,保留了推理、工具调用和编码能力。在 M3 Max 上测试,该模型在 1 小时内编写了一个 targeting ARM64 的 C 编译器,并通过了 Fibonacci 和 FizzBuzz 测试。
核心技术点:
- 高效量化:使用 mlx-iqk 库,利用 IQK 张量编码,比 llama.cpp 或基础 MLX 更高效。
- 专家修剪:针对编码用例,从 40 层路由器中移除了 80B 不重要参数(REAP 技术)。
- 动态布局:在 Metal 设置下调整为 k-contiguous 布局以提升速度。
该方案可在 32GB MacBook 上运行(128K 上下文,约 5 tok/s),甚至在 16GB M1 Air 上也能以 1.39 tok/s 运行。相关代码已开源。
「Infra」频道最新
- DSCO Router 推出多模型统一网关,支持自带账号自动路由 — arthurcolle · 2026-08-24
- 开源方案 RobotSoul:为 Agent 提供上下文重置后的持久身份 — robauto-dot-ai · 2026-08-24
- 将 MoE 模型卸载至 RAM 运行会遭遇极慢的 Prefill — former_farmer · 2026-08-24
- Etched获10亿美元融资,Jane Street领投验证专用芯片 — TheTuringPost · 2026-08-24
- ConvRot 量化方法入驻 llama-cpp,Q6 接近 Q8 精度 — giveen · 2026-08-24
- LifeOS:基于本地模型的语音驱动个人管理工具 — Extension-Bid-639 · 2026-08-24