clef-flash 蒸馏成 0.6B 模型跑 Apple Neural Engine,57 秒分流 1000 工单

art_zucker · x · 2026-10-11

FluidInference 将 clef-flash(9B)蒸馏到基于 Qwen3-0.6B 的文本决策模型 clef-text-0.6b,并发布 Core ML 版本,可完全跑在 Apple Neural Engine 上。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →