本地跑 276B 多模态模型实测:32k 上下文显存占用 93GB
MaziyarPanahi · x · 2026-08-01
MaziyarPanahi 分享了在本地运行 Inkling 276BA12B 多模态大模型(3-bit 量化)的真实性能数据。
在默认 1M 上下文下,模型常驻内存达 127GiB;若限制在 32k 上下文则降至 93GiB。模型权重占 91GB,音频编码耗时 575ms,生成回答需 103s。他建议本地运行时最好限制上下文长度。
所属事件:Inkling 276B多模态模型本地实测:精准诊断心衰(3 条相关)→
「Infra」频道最新
- Modal 发布硬核 GPU 术语表,涵盖硬件到软件全栈 — charles_irl · 2026-08-01
- ARM 引入 FEAT_CSSC 扩展:原生支持通用寄存器 popcount — lemire · 2026-08-01
- 推理费每天超 750 美元就该自研?Pallet 分享模型训练账本 — marcbhargava · 2026-08-01
- 实测百 GB 级音频大模型本地推理:1M 上下文吃满 127GB 内存 — andimarafioti · 2026-08-01
- Llama 3.1 405B 已在 Cerebras 推理,速度达 5.6k t/s — kimmonismus · 2026-08-01
- MediaTek 预计明年下半年推出 400G/448G SerDes IP — rwang07 · 2026-08-01