Inkling-276B 多模态模型本地实测:3-bit 量化成功跑通音视频

MaziyarPanahi · x · 2026-08-02

开发者 Maziyar Panahi 分享了多模态模型 Inkling-Small(276B A12B 架构)在本地设备(Metal)上的最新实测数据。

在 3-bit 量化下,该模型占用了约 91.19 GiB 显存。推理速度方面,上下文处理(pp512)达到约 510 tokens/s,生成速度(tg64)为 37 tokens/s。实测中,他成功让模型同时处理图像和音频输入,并准确分析了一段 2 分钟的关于膝盖病情的医患就诊音频,甚至精准推断出患者停用利尿剂导致心衰恶化的病因。

所属事件:Inkling 276B多模态模型本地实测:3-bit量化跑通医疗诊断(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →