非对称量化实战:医学模型体积缩至 1/16 仅损 0.01 精度
lateinteraction · x · 2026-08-27
开发者将 Mixedbread AI 的非对称量化应用于 mLateOn-medical 模型。结果显示,模型存储从 45 GB 降至 2.8 GB(缩小 16 倍),而 NDCG@10 评分仅从 0.916 降至 0.906。该方案在存储与质量的权衡上表现优异,并提供了一行代码复现。
「Infra」频道最新
- 散户看好美光:越来越多信号显示 2028 年存储价格不会崩 — JOBhakdi · 2026-08-27
- 分析师低估 Lam Research 增长,未来 12 个月刻蚀机销量或暴涨 — zephyr_z9 · 2026-08-27
- NVIDIA 早期通过减半操作数位宽,在不增加 ALU 面积下提升吞吐 — yunta_tsai · 2026-08-27
- GPU 租用平台实测:Docker 模板与启动脚本乱象 — big-in-jap · 2026-08-27
- 数据中心是“智能工厂”:能源是新工业血液 — NinaDSchick · 2026-08-27
- 在 Slack 集成 Warp 工厂运行成本监控以优化模型路由 — vikvang1 · 2026-08-27