Fractale-350M:将记忆作为训练行为的开源模型
KKuettes · reddit · 2026-07-20
独立研究者发布了 Fractale-350M-base 模型,探索了一种全新的长期记忆机制:将记忆作为训练行为而非依赖长上下文。
核心设计
- 记忆库机制:模型唯一的长期记忆是一个包含 8 个向量的记忆库。模型每处理 512 个 token 就会自行写入一个摘要向量,并采用 FIFO(先进先出)方式淘汰最旧的记忆。
- 超网络读取:记忆库中的向量通过超网络扩展为低秩 MLP,直接参与前向传播,而非传统的文本检索或注意力机制。
- 预训练目标:强制模型仅依赖这 8 个记忆向量来预测下一个未见过的文本块的开头。
实验数据
- 记忆依赖度(GAP):在代码数据集上,保留记忆与重置记忆的交叉熵差异高达 9.4 nats(CE 从 12.9 降至 3.45);网页数据上为 7.3 nats。这表明模型在训练过程中对自身记忆的依赖度不断加深。
- 机制验证:在更小规模的对照实验中,证实记忆内容可通过线索寻址,能在 2000+ 步后存活,且能双向传递信息(如文档字符串与代码之间)。
开源与限制
- 这是一个 base 模型,未经过指令微调和对齐,原始流畅度符合 3.86 亿参数(训练于 100 亿 token)的预期。
- 模型仅记忆“要点”(如领域、结构、事实),无法逐字背诵原文。
- 完全开源:包含模型、代码、完整研究日志及论文。预训练总成本约 320 美元(8xA100 租用费用)。
作者计划在第二阶段通过指令微调和强化学习,教导模型主动且刻意地使用这些记忆。
「模型」频道最新
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- Terminal Bench v4 榜单:GLM-5.3 以 41.9% 一骑绝尘 — Ok_Warning2146 · 2026-09-11