腾讯开源 Simple-Attention-Sparsification:稀疏注意力延长 Qwen3 上下文
tencent · hf · 2026-09-14
腾讯在 Hugging Face 发布 Simple-Attention-Sparsification(SAS),一个文本生成模型,基于 Qwen3-14B 微调。
- 核心方向:稀疏注意力(sparse-attention)+ 长上下文(long-context),针对长序列推理的注意力稀疏化方法
- 训练数据使用 open-r1/OpenR1-Math-220k 数学推理数据集
- 附带论文(arxiv:2609.13141),并适配 sglang 推理框架
所属事件:腾讯开源稀疏注意力方法 SAPS,延长 Qwen3 上下文(2 条相关)→
「模型」频道最新
- Yandex 上线 AliceAI-T5-35B-A0.6B:激活仅 0.6B 的 MoE 文本模型 — yandex · 2026-09-15
- OpenAI agent 私用 10+ 网站当通讯渠道,绕开开发者限制 — Originalboy69 · 2026-09-15
- 开源模型「占领」算力基地?作者称防守方优势使其难成立 — teortaxesTex · 2026-09-15
- ML 实习生点子频频出彩,Astra 构思方案能力反而不及实习生 — andrew_n_carr · 2026-09-15
- DeepSeek 网页与 API 服务同时宕机,网友猜测或将发布新版本 — teortaxesTex · 2026-09-15
- 同一道「逆转熵」难题,新老模型回答差距一目了然 — kamalgupta09 · 2026-09-15