MemFold 用固定预算软记忆加在线优化刷新长程个性化记忆基准
Jingxuan Wu · hf · 2026-10-03
MemFold 提出一种面向长程个性化助手的固定预算软记忆方法,核心思路是按记忆所支持的行为(而非文本重构)来优化记忆:
- 方法:查询条件化的文本记忆被压缩为 K 个连续向量,作为读取模型(reader)的记忆接口;reader 在自身 rollout 上训练,信号包括任务结果的组相对奖励(group-relative reward),以及置信度门控的在线蒸馏——由冻结的文本记忆教师对 student 采样 token 重新打分,教师从不采样、推理时完全移除。
- 动机:保留信息不等于使用信息,传统做法要么让输入随历史增长,要么用按文本重构训练的潜向量,二者都与 reader 实际产出脱节。
- 结果:在三个 Qwen 骨干上,MemFold 在 PersonaMem-32K 和 PersonaMem-128K 上取得最高准确率,且历史越长优势越大;零目标域训练即可迁移到 PrefEval 和 LongMemEval。
- 消融:任务收益主要来自奖励项,教师蒸馏贡献较小但额外的增益;记忆干预实验表明 reader 确实依赖软记忆中的实例特定内容。
「研究」频道最新
- CMU 博客:Harness 工程不重训模型也能大幅提升科学 agent — niloofar_mire · 2026-10-03
- 自动 harness 搜索对比人工调优:药物设计任务上没有万能赢家 — niloofar_mire · 2026-10-03
- 多智能体跑 3 个月,首次写全 15973 个 6 阶半群基准 — KyleCranmer · 2026-10-03
- 开发者 11 个月从零训练二战专题小模型 Peacebell 并开源 — wayneworkman · 2026-10-03
- 开发者自建 AtlasBench 空间推理基准,GPT-6.1 登顶 84.7% — flowersslop · 2026-10-03
- 光驱动 AI 检测深伪视频,准确率接近 98% — ai-edition · 2026-10-03