Inkling-276B 多模态模型本地实测:3-bit 量化成功跑通音视频
MaziyarPanahi · x · 2026-08-02
开发者 Maziyar Panahi 分享了多模态模型 Inkling-Small(276B A12B 架构)在本地设备(Metal)上的最新实测数据。
在 3-bit 量化下,该模型占用了约 91.19 GiB 显存。推理速度方面,上下文处理(pp512)达到约 510 tokens/s,生成速度(tg64)为 37 tokens/s。实测中,他成功让模型同时处理图像和音频输入,并准确分析了一段 2 分钟的关于膝盖病情的医患就诊音频,甚至精准推断出患者停用利尿剂导致心衰恶化的病因。
所属事件:Inkling 276B多模态模型本地实测:3-bit量化跑通医疗诊断(5 条相关)→
「模型」频道最新
- 阿里云发布 Qwen3.8-Max,主打编码与协作能力 — Alibaba_Qwen · 2026-08-03
- 开源模型仍落后闭源:K3 慢,Opus 等依然领先 — bindureddy · 2026-08-03
- Sakana AI 推出 Namazu API:基于 Kimi K2.6 的日本特化大模型 — SakanaAILabs · 2026-08-03
- Nemotron 3 Nano Omni 本地实测:单机跑出 264 tok/s — ivan_bezdomny · 2026-08-03
- Sol 5.6 模型行为观察:会自动屏蔽干扰请求 — MannyKayy · 2026-08-03
- Kimi K3 Max 智能体实测:单美元解决任务数达 2.8 倍 — togethercompute · 2026-08-03