韩国论文 Naju 把保留和写入门分开做状态更新
TheTuringPost · x · 2026-07-29
Naju 用“记忆门”和“写入门”分开控制状态更新
这篇来自韩国研究团队的论文提出了 Naju:一种原生离散状态空间模型,把 LSTM 里“保留”和“写入”分离控制的思路重新带了回来。
- 一个门决定已有状态保留多少。
- 另一个门决定新信息写入多强。
- 和耦合式单门设计不同,Naju 允许“边保留边写入”,两者可以同时很高。
论文里,模型在 512 token 序列上训练,并在 2,048 token 上测试,保留准确率达到 0.99,覆盖/改写准确率达到 0.89。对比实验中,xLSTM 更擅长记忆,GLA 更擅长改写,但都没法两项兼顾。
作者也给出两个限制:
- 速度:在 32K token 时,Naju 比 Mamba 慢 2.2 倍,比 Mamba-2 慢 3.3 倍。
- 扩展性:目前只在 WikiText-103 和 1.2B token 训练预算的小规模实验里验证,是否能大规模泛化还不清楚。
所属事件:韩国团队提出 Naju 模型引入双门控机制(2 条相关)→
「研究」频道最新
- InfinityEdit:无限视频编辑,仅靠轻量级适配器实现 — Yunze Tong · 2026-08-24
- 腾讯发布混合思维 MLLM 基准,对齐响应模式 — tencent · 2026-08-24
- CLEAR 适配器路由,保留效用的 LLM 安全对齐 — UIUC-CS · 2026-08-24
- 2.7-bit量化把Llama 3.2 Vision 11B压到3.7GB上手机 — Luka Ribar · 2026-08-24
- Retriever 框架:解决机器人异步闭环编程难题 — ZeYanjie · 2026-08-24
- 高斯混合模型与指数族密度逼近转换 — FrnkNlsn · 2026-08-24