帖子称一款注意力骨干模型有 104B 激活参数
zephyr_z9 · x · 2026-07-28
一条简短引用提到“很重的 attention backbone”,并补充说这是一款 104B active 的模型,比预想大得多。
虽然上下文很少,但能确认的核心信息是:这是一条关于模型架构规模的线索,重点在于其激活参数量远超评论者预期。
「模型」频道最新
- Kimi K3 报告提出 SiTU-GLU:可控上界的门控近似 SwiGLU — stochasticchasm · 2026-07-28
- Kimi K3 的 MoE 路由可能推高专家并行通信 — stochasticchasm · 2026-07-28
- Kimi K3 发现 16 个新漏洞并领先 GLM-5.2 — zephyr_z9 · 2026-07-28
- Kimi K3 权重分片已现身为 96 份 safetensors — ricklamers · 2026-07-28
- 微软发布 MAI-Cyber-1-Flash,称 CyberGym 成绩领先且成本减半 — satyanadella · 2026-07-28
- Claude Opus 5 迁移指南悄悄改写了多年提示词建议 — AlexKim · 2026-07-28