开源 33B 多模态模型 Agnes-3.0-Flash:混合注意力架构,262K 上下文
Skyline34rGt · reddit · 2026-09-12
Agnes-AI 发布开源 33B 多模态模型 Agnes-3.0-Flash(Artificial Analysis 评分 36,且被其误标为专有模型)。架构为混合注意力解码器:每 4 层中 3 层是门控 delta rule 循环层(状态与序列长度无关),1 层是全局注意力,72 层中仅 18 层持有 KV cache。
关键规格:
- 262,144 token 上下文,词表 248,320
- 全局注意力层用 6:1 GQA(24 query heads / 4 KV heads),delta-rule 层 16 key / 48 value heads,循环状态 fp32
- SwiGLU 前馈 + 每层并行 SwiGLU 分支;三轴 mrope 旋转位置编码
- 27 层视觉塔,支持文本、图像、视频理解,可调推理强度,支持工具调用
「模型」频道最新
- 20B-32B 是完美模型尺寸?Reddit 用户看好中小型模型甜点区 — Robert__Sinclair · 2026-09-12
- 程序员热议 GPT-6 Astra:快而省钱但代码「越来越不像人写的」 — beffjezos · 2026-09-12
- 单张 RTX 5090 跑 502GB 模型:DeepSeek V4.1-Flash 展示本地 AI 新架构 — AccBalanced · 2026-09-12
- Codex 额度重置开始推送,GPT-Image 2.5 疑带新草图功能 — koltregaskes · 2026-09-12
- Orca 发布 DeepSeek V4.1 Flash 去审查 MLX 权重,面向安全研究 — AccBalanced · 2026-09-12
- 曝 DeepSeek V4.1 Flash 上线首日付费 token 超 3.1 万亿,稳定 230-300 TPS — AccBalanced · 2026-09-12