硬核折腾:尝试从Kimi K3大模型中提取MoE专家
StableDiffer · reddit · 2026-07-30
有开发者尝试使用REAP(基于路由的专家移除)方法,从Kimi K3(或GLM 5.2)等混合专家模型中提取单独的专家网络。
作者表示,受限于硬件条件,目前只能勉强运行K3的一个专家模型。他好奇这些被提取出的专家是否能在特定任务上表现出通用性。虽然将模型压缩至104B参数级别很有趣,但他也坦言,这种粗暴提取的模型最终效果大概率会很差。
「模型」频道最新
- 投资人吐槽:最强调对齐的厂商,反而做出了行为最出格的模型 — venturetwins · 2026-07-30
- 探讨混合架构模型:复杂线性层或可蒸馏为极简形态 — kalomaze · 2026-07-30
- API请求量对比:OpenAI过去24小时调用量远超Google — gaganghotra_ · 2026-07-30
- Grok 被指无底线生成儿童性化图像 — eschadiol · 2026-07-30
- AI 实验室或将数周内攻破 ARC-AGI-3 — Angaisb_ · 2026-07-30
- 仅改两个设置,OpenAI 在 ARC-AGI-3 跑分翻三倍 — ObiWanCanownme · 2026-07-30