Fractale-350M:将记忆作为训练行为的开源模型
KKuettes · reddit · 2026-07-20
独立研究者发布了 Fractale-350M-base 模型,探索了一种全新的长期记忆机制:将记忆作为训练行为而非依赖长上下文。
核心设计
- 记忆库机制:模型唯一的长期记忆是一个包含 8 个向量的记忆库。模型每处理 512 个 token 就会自行写入一个摘要向量,并采用 FIFO(先进先出)方式淘汰最旧的记忆。
- 超网络读取:记忆库中的向量通过超网络扩展为低秩 MLP,直接参与前向传播,而非传统的文本检索或注意力机制。
- 预训练目标:强制模型仅依赖这 8 个记忆向量来预测下一个未见过的文本块的开头。
实验数据
- 记忆依赖度(GAP):在代码数据集上,保留记忆与重置记忆的交叉熵差异高达 9.4 nats(CE 从 12.9 降至 3.45);网页数据上为 7.3 nats。这表明模型在训练过程中对自身记忆的依赖度不断加深。
- 机制验证:在更小规模的对照实验中,证实记忆内容可通过线索寻址,能在 2000+ 步后存活,且能双向传递信息(如文档字符串与代码之间)。
开源与限制
- 这是一个 base 模型,未经过指令微调和对齐,原始流畅度符合 3.86 亿参数(训练于 100 亿 token)的预期。
- 模型仅记忆“要点”(如领域、结构、事实),无法逐字背诵原文。
- 完全开源:包含模型、代码、完整研究日志及论文。预训练总成本约 320 美元(8xA100 租用费用)。
作者计划在第二阶段通过指令微调和强化学习,教导模型主动且刻意地使用这些记忆。
「模型」频道最新
- Gemini 3.6 Flash 上线 Google AI Studio,输出更便宜 — gaganghotra_ · 2026-07-21
- Jack Clark 称 OpenAI 公开安全笔记有助前沿社区 — jackclarkSF · 2026-07-21
- Mindlab Research 将 Macaron-V1-Venti 发布到 Hugging Face — External_Mood4719 · 2026-07-21
- Google 在 AI Studio 里放出 Gemini 3.5 Flash-Lite 和 3.6 Flash — Expensive_Syrup_6529 · 2026-07-21
- ChatGPT 常先讲结构原理,却没先回答墙是否倾斜 — Aware-sky-3489 · 2026-07-21
- Grok 网站流量同比增长 38.15%,Q2 达 7.36 亿次 — XFreeze · 2026-07-21