放弃模仿 Transformer:开发者重构 CPU 优先的脉冲语言模型
zemondza · reddit · 2026-08-12
独立开发者分享了其脑启发混合脉冲语言模型项目 Project NORD 的最新进展。在时隔半年的回归中,他决定不再修补旧架构,而是重构出 NORD 5.5 — Flash。
新架构的核心目标是探索完全以 CPU 友好型推理为导向的脉冲/循环语言模型,而非先模仿 Transformer 再去优化。主要改动包括:
- 简化时间轴:移除了旧版中人为的内部脉冲时间扩展,直接将语言序列本身作为时间轴,大幅减少了需处理的中间状态。
- 架构重组:采用严格因果处理,移除主热路径中的标准二次注意力,引入因果卷积、Top-1 稀疏 MoE(含共享专家)以及持久循环记忆。
- 修复旧缺陷:修正了旧架构中部分模块非真正因果、记忆状态与序列形状绑定过深等问题。
作者坦言目前仍是实验性架构,不保证能超越现有模型。下一步计划是实际训练并对比 CPU tokens/sec、显存占用、困惑度及长上下文表现等指标。
所属事件:开发者重构脉冲语言模型NORD 5.5(3 条相关)→
「研究」频道最新
- Kimi K3 蒸馏争议:论文作者承认未证实,或为数据污染 — bookwormengr · 2026-08-12
- RefineAny3D:用微调VLM优化单目3D检测 — kwangmoo_yi · 2026-08-12
- 表格 ML 难题:分类变量何时应单独建模? — mariofilhoml · 2026-08-12
- 前沿大模型缺乏心智理论,开发者呼吁引入RL训练 — lateinteraction · 2026-08-12
- 伯克利等提出MLS-Bench:AI Agent能搞科研,但还提不出新方法 — 机器之心 · 2026-08-12
- AI分析师Agent失败分析:57%因锚定错误假设,Gemini与Grok差异显著 — ArtificialAnlys · 2026-08-12