Qwen3.8-27B与3.6架构完全相同,能力提升全靠训练改进
Course_Latter · reddit · 2026-08-15
Reddit用户发现Qwen3.8-27B与Qwen3.6-27B架构完全一致(0处差异),意味着能力提升全部来自训练改进。这暗示了训练方法的重要性。
「模型」频道最新
- Orion-16B突破100B训练token,采用去中心化算力 — const_reborn · 2026-08-15
- AI模型评测:基线被碾压,最佳模型接近完成课程 — const_reborn · 2026-08-15
- Qwen3.8获LightSeek Day-0支持,推理性能提升30%+ — Alibaba_Qwen · 2026-08-15
- DeepSeek 推理成本碾压?网友称 GLM 5.3 限额爆掉,DS 轻松应对 — teortaxesTex · 2026-08-15
- Grok 4.6 性能大增:智能如Fable,速度如Sonnet,成本更低 — vikvang1 · 2026-08-15
- Qwen3.8-27B-FP8在GH200上实现10路并发流式推理,首包延迟10ms — MaziyarPanahi · 2026-08-15