单卡 4090 训练多语言 3.7B MoE 模型
Significant_Focus134 · reddit · 2026-09-01
作者发布了名为 Polanka 3.7B 的多语言 MoE 模型,完全在单张 RTX 4090 上耗时数月从零预训练。该模型支持 13 种语言(含中英),并对 PL/EN/ZH 进行了数据增强,目前以研究工件的形式开源。
「研究」频道最新
- OpenBind 预印本发布,含新虚拟筛选基准 — MoAlQuraishi · 2026-09-02
- Anandkumar 发布 acceleratedU:神经算子替代 Transformer 做物理预测 — AnimaAnandkumar · 2026-09-02
- 数学家新博客:探讨 AI 如何重塑数学研究 — giannis_daras · 2026-09-02
- EMNLP 2026 接收论文:用结构化先例提升法律推理 — ponguru · 2026-09-02
- Sharon Zhou:FLOPs 相对显存变便宜,算法将转向以算力换显存 — realSharonZhou · 2026-09-02
- YOLO26深度骨干迁移到去雨任务:10个测试集全胜随机初始化 — Naive-Explanation940 · 2026-09-01