宽切半蒸馏 Muse 30B 得 14B,60 项工具任务通过 57 项
ZenZombie117 · reddit · 2026-09-28
开发者将喜欢的 Muse-Glimmer-30B 按宽度切半(隐藏维 6656→5760、FFN 19968→10240、注意力头 32→24,保留全部 52 层),再用其子模型 Ornith-1.0-9B 作为工具调用策略教师,纯蒸馏(无 RL)得到 Xyntetik-Kvist-14B,Apache-2.0 开源。
关键数据:
- 工具任务:60 项 held-out 闭环任务(联系人/天气/航班/汇率/日期/单位/股票)通过 57 项(以对 ground truth 重执行调用判定;母模型 60,未训练对照 0);
- 蒸馏:6000 步、9830 万 token、162 小时,再加 1440 步智能体轨迹;
- 保真度:KLD 0.762,45056 个 held-out 位置上 margin-qualified top-1 为 84.0%;
- 格式:200 个首轮 199 个格式良好,99/99 工具调用有效;
- 量化:Q80 为 15.4 GB,可整体装入 24 GB 显卡,通过 Xyntetik Runner 提供 OpenAI/Anthropic/Responses 兼容 API,可直接嵌入现有 agent 循环;
- 弱点:无计算器时算术会错(160 项计算任务仅过 12),约 7/160 的运行陷入推理循环;项目公开了全部 12 次训练尝试的记录与缺陷。
「模型」频道最新
- 曝 Gemini 4 Pro 泄露跑分碾压 OpenAI 与 Anthropic,抢在 Dev Day 前刷屏 — CurieuxExplorer · 2026-09-28
- 爆料称 OpenAI DevDay 将有三大发布:常驻 Agent 与 ChatGPT 整合 — mark_k · 2026-09-28
- GPT-Astra-6 编码任务翻车,用户怒斥「租智能」是骗局 — alexcovo_eth · 2026-09-28
- Guillaume Verdon:谷歌 Astra 比传闻中 Opus 更有大模型味 — beffjezos · 2026-09-28
- 前 CoT 时代的「手动思维链」:老研究者回忆早期玩法 — gandamu_ml · 2026-09-28
- Astra 6 发布后急转直下,用户质疑厂商发布前暗中削弱模型 — alexcovo_eth · 2026-09-28