2.7-bit量化把Llama 3.2 Vision 11B压到3.7GB上手机
Luka Ribar · hf · 2026-08-24
Llama-Mobile 提出一套面向移动端部署的视觉语言模型量化框架。
- 采用 2.7-bit 量化格式,并用模型自生成数据做训练,无需人工标注。
- 效果:把 Llama 3.2 11B Vision Instruct 压缩到 3.7 GB,可装进手机,同时视觉问答性能基本保持。
「Infra」频道最新
- WULF CEO 揭秘:数据中心闭环系统极省水 — robleclerc · 2026-08-24
- Cursor 团队推 Git 大规模架构,力挺无状态化存储 — thesephist · 2026-08-24
- Cursor 团队 Git 大作获赞:无状态存储将重写基础设施 — thesephist · 2026-08-24
- AI 性能工程资源清单 v2 发布:从单次推理到 MoE serving 全覆盖 — AccBalanced · 2026-08-24
- 韩国半导体工程师地位超越医生,家长意愿成风向标 — SuB8u · 2026-08-24
- 现代编程的“VendorOps”困局 — vboykis · 2026-08-24