gstack 推出基于 Kimi K3 权重的 RL 微调版
vikvang1 · x · 2026-08-15
开发者发布了 gstack 的蒸馏版本,该版本在 Kimi K3 的权重上进行了强化学习(RL)微调。
「模型」频道最新
- 吐槽 Meta 万亿投入:国产 Qwen3 性能却后来居上 — ccerrato147 · 2026-08-15
- Qwen 3.8 27B在AMD上跑出51 t/s,用户实测分享 — pmttyji · 2026-08-15
- DeepSeek落后?网友称其当前不如Anthropic、OpenAI等 — scaling01 · 2026-08-15
- Polymarket 开赌 DeepSeek 下一代 Pro:11月底概率60% — Polymarket · 2026-08-15
- 新基准揭示大模型视觉感知薄弱,准确率均未达 60% — The Decoder · 2026-08-15
- DeepSeek 正开发 Flash 变体:拟让 250B 模型具备 3T 编程水平 — bindureddy · 2026-08-15