clef-flash 蒸馏成 0.6B 模型跑 Apple Neural Engine,57 秒分流 1000 工单
art_zucker · x · 2026-10-11
FluidInference 将 clef-flash(9B)蒸馏到基于 Qwen3-0.6B 的文本决策模型 clef-text-0.6b,并发布 Core ML 版本,可完全跑在 Apple Neural Engine 上。
- 在 M5 Pro 上 57 秒分流 1000 条客服工单(每张约 48ms),输出团队、紧急度与退款判断,与 9B 教师模型分类成绩相差仅几分
- 模型接口与 Clef/Jev/SystemOne API 一致:一次前向传播输出所有问题的概率,支持 choice/score 等类型化输出
- 权重约 848MB(解码器 fp16)+ 197MB schema head + 297MB 词嵌入,Apache-2.0 开源,附 Swift 运行时 ClefTextManager
- 在路由与分类任务上接近教师模型,但在知识推理类任务(ARC-Challenge、CommonsenseQA)差距明显
「Infra」频道最新
- IEEE 预计发达国家储能两年内翻倍,科技基建已占全球用电约一成 — ingliguori · 2026-10-11
- 佛州三大电力公司结盟共建数据中心基础设施 — 4KTV · 2026-10-11
- TensorFold 1.0.7 上线 Living Weights:一条事实写入约 10 个新神经元 — HankYeomans · 2026-10-11
- 中国在建 38 座核反应堆约 39.8GW,能源被视为 AI 最大瓶颈 — kimmonismus · 2026-10-11
- token 降价反花更多钱:开发者实测 agent 时代的 Jevons 悖论 — daniel_mac8 · 2026-10-11
- Tenstorren服务器每美元折叠效率达H200四倍,抗体对接成功率19%升至84% — DavidBennett__ · 2026-10-11