开发者将 Gemma2-4B 升级为 4 专家 MoE 模型
Desperate-Sir-5088 · reddit · 2026-09-01
一位开发者分享了将 Gemma2-4B 密集模型改造为混合专家模型的实验结果。通过添加 4 个专家,模型能力恢复至“通用水平”。该开发者同时喊话 Google 希望尽快发布官方的 124B MoE 模型。
「模型」频道最新
- Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored 登顶 HF — DavidAU · 2026-09-01
- Matrix-Game 3.5:用 Patch Memory 增强实时流式世界模型 — Runjia Qian · 2026-09-01
- Qwen 团队发文解析 Qwen3.8-Next 架构设计 — Qwen · 2026-09-01
- 智谱 GLM-5.3 Flash 推出 INT4 与 MXFP4 版本 — HaihaoShen · 2026-09-01
- Qwen 2.5 72B 本地实测:长上下文吞吐跌一半 — julianharris · 2026-09-01
- DeepSeek 等模型 SWE-bench 得分辟谣:未达 80% — teortaxesTex · 2026-09-01