日本医生个人三值化 Qwen27B,51.5GB 压到 7.3GB 仍可看图生提示词
udmrzn · x · 2026-10-01
- 日本一位主业为医生的开发者「石ちゃん」发布了 Mitsuba(三葉):对 Qwen3.8-27B 做三值化(ternary)量化的 ComfyUI/VLM 特化模型,体积从 51.5GB 压缩到约 7.3GB(约 14%),据称是日本个人首次完成此类三值化并公开。
- 用途非常单一:看图 → 生成图像/视频生成提示词(配合 Krea 2 等 I2T2I 流程)。相比原模型,图像识别 89.8→87.8,生成提示词达标率 3/10→6/10;代价是编码能力 66→4。
- 使用注意:需 PrismML 版 llama.cpp,建议关闭 Thinking;不适用编码任务,无审查版制作中。
- 讨论者认为「用自定义量化做专用功能模型」是新的方向:专用化后 27B 模型或许 8GB 显存即可运行。
「Infra」频道最新
- Pareto 与 Engy 达成合作,将 Bittensor SN10 推理优化输出给第三方客户 — markjeffrey · 2026-10-01
- Respan 发布 Span-01 模型路由器:比单模型省 37% 成本 — ycombinator · 2026-10-01
- 实测 RTX 3090 功耗可降至 120W,推理省电又降温 — QuixiAI · 2026-10-01
- AI 当编译器:模型直出 PTX 汇编,FlashAttention 提速 1.37x — Azaliamirh · 2026-10-01
- Dell 首批 Vera Rubin NVL72 整机架系统量产出货 — yenkel · 2026-10-01
- 芝浦工大 Ozaki Scheme II 入选 CUDA 13.4,用低精度算力跑高精度计算 — udmrzn · 2026-10-01