开源训练实录:EDA 优于 GDN-2,连续 7 次主机故障自动切换专家
jon_durbin · x · 2026-10-08
开发者 jondurbin 更新其开放模型训练进展:
- EDA(linear attention 变体)表现优于 GDN-2,且完全避开了此前的失败机制;新 run(lambda)进度大幅超过旧 run(kappa)。
- 训练过程遇到 7 次 host 故障,专家所有权自动 failover 机制均成功接管。
- 尝试将 triadic linear attention 适配到 EDA 以提升长上下文能力,但未观察到明显收益(作者自评可能是实现问题),实验代码已公开。
「Infra」频道最新
- 600M 小模型跑上 Apple Neural Engine:内容审核 224 条/秒,与人评一致率 95.4% — huggingface · 2026-10-08
- 美国航空将为全部1030架飞机装星链,最高1Gbps — XFreeze · 2026-10-08
- 单个脉冲神经网络用局部学习规则同时编码内容、时间与概率 — MacrinePhD · 2026-10-08
- 玩家拼 CPU/RAM/SSD/GPU 混合系统,跑通 512K 上下文 — HankYeomans · 2026-10-08
- PyTorch 大会设 ExecuTorch 专题讨论,聚焦端侧部署学习路径 — PyTorch · 2026-10-08
- CMP 170HX 10GB 卡有望解锁至 48GB,社区改造进展顺利 — chemist_slime · 2026-10-08