状态空间模型让递归回归:线性成本融合 Transformer 时代技巧
anshulkundaje · x · 2026-10-10
一条精炼的技术观察:状态空间模型(SSM)把递归结构重新带回序列建模,同时保持对序列长度的线性计算成本,并吸收了 Transformer 时代的关键改进——
- 并行计算:训练时可像 Transformer 一样并行,不必按时间步串行;
- 多头模块:借鉴 multi-head 设计;
- 数据依赖参数:让每个位置自行决定往状态里写入什么、遗忘什么,这是现代 SSM(如 Mamba 系)区别于老式 RNN 的核心。
「模型」频道最新
- Delip Rao 质疑微软新模型:为何基准测试不敢比准确率 — deliprao · 2026-10-10
- Gemini 4 Argon 发布:DeepSWE 得分 77.9%,超 Claude Opus 5.5 的 74.2% — dl_weekly · 2026-10-10
- Polymarket 开盘:Anthropic 本月暂停 AI 训练概率仅 28% — Polymarket · 2026-10-10
- Netlify 直播盲测 Anthropic/OpenAI/Mistral 新模型,同题四模型匿名对比 — thisiskp_ · 2026-10-10
- 曝 Google 向内部员工测试 Gemini 4 "Carbon",编码表现「像 Opus 5.5」 — gaganghotra_ · 2026-10-10
- 实测称 max 推理档更贵反而跑输,多数编码任务用 high 就够 — weswinder · 2026-10-10