本周开权重模型盘点:Laguna S 2.1 到 100 万上下文
rasbt · x · 2026-07-26
本帖整理了这一周几款值得注意的开权重模型,并重点看了它们的架构取舍和实际跑起来的差异:
- Nanbeige 4.2 3B 采用 looped depth sharing,等于把同一套 22 层 Transformer 跑两遍,在不复制权重的情况下把计算深度扩到 44 层。作者引用技术报告称,两遍是最佳平衡点,token 效率仍能保留大约 75%。
- Laguna S 2.1 是一个 118B sparse MoE,激活参数 8B,上下文窗口达到 100 万 token。作者特别提到它在自己的 DGX Spark 上居然还能跑,峰值内存不到 80GB,因此是他眼下最感兴趣的模型之一。
- Motif-3-Beta 是一个 314B-A13B sparse MoE,思路上借鉴了 DeepSeek V4 的 mHC 和 latent attention,但加入了新的 Grouped Differential Latent Attention 组件。
- Solar Open 2 是 Upstage 的 250B-A15B hybrid MoE,在结构上交错使用 Kimi Delta Attention 和 GQA。
- Antares 1B 以及更小的 0.3B 版本面向终端侧网络安全任务,基于 IBM Granite 4.0 1B backbone,再用 SFT + GRPO 做了任务特化后训练。
配图还给出了与 Qwen3.6 35B-A3B Q4 的 prefill、decode 速度和显存占用对比,突出 Laguna S 2.1 在大上下文下的速度/内存权衡。
「模型」频道最新
- Claude 写 Opus 5 批评时总在替它辩护 — sethlazar · 2026-07-26
- Unsloth 的 Qwen3.6-35B-A3B GGUF 在 HF 走红 — unsloth · 2026-07-26
- SOOFI 多训练 2T tokens 后,仍可能只是追平 Nemotron 3 Nano — JJitsev · 2026-07-26
- 让 Claude 先追问澄清,能直接挖出遗漏前提 — Commercial-Most3081 · 2026-07-26
- 用户称 Claude Opus 5 比 GPT-5.6 Sol 更有常识感 — dejavucoder · 2026-07-26
- 前沿模型生物幻觉少了,却更爱乱用术语 — owl_posting · 2026-07-26