HF 新研究:把语言模型的存储、执行与神经协调彻底分离
A. Bochkov · hf · 2026-10-09
Hugging Face 上新论文 FEM-ASM 提出让语言模型系统将上下文计算、持久存储与精确执行分离,而非把所有能力塞进共享参数:
- 受有限元法启发,独立构建的文档状态与确定性可执行技能向共享语言模型状态提交类型化提案,由显式残差算子在公共接口节点上调和。
- 无注意力的 Multi-Mesh 原型可完成因果语言建模,但未达到有竞争力的通用能力。
- 版本化存储含 52,809 个重构记忆元素,约 17 亿浮点值预算,token 重构准确率约 75%;支持感知的词法索引使其可按来源受控的查询寻址。
- 可执行算术实验显示:位置性结果观测比重复全局结果向量显著改善神经渲染;输出替换会改变模型偏好答案。
结论支持存储/执行/神经协调三者分离的架构方向,同时坦承在仅问题检索、无约束答案生成与端到端效率上的局限。
「研究」频道最新
- 自动驾驶一线经验沉淀:半监督学习“炼金术”长文 — Visual_Ability · 2026-10-09
- RLVR 被指忽视「求所有最小解」类问题:新方法找到解数量翻倍 — thoma_gu · 2026-10-09
- 有人辟谣:AI并未解决千禧年难题Navier-Stokes,Lean证明偷换概念 — gerardsans · 2026-10-09
- 新开源基准3JSBench:前沿模型能解千禧难题却建不好3D物体 — ycombinator · 2026-10-09
- Moonworks 发布 Lunara:扩散混合 Transformer 主打艺术审美,人类盲评全场最高 — paper-crow · 2026-10-09
- 实测 ChatGPT 与 Gemini 引用偏好:巴西本地域名占比达 41.4% — gaganghotra_ · 2026-10-09