arXiv 论文「记忆信任鸿沟」:Agent 记忆过信任随模型规模变化
rohanpaul_ai · x · 2026-09-06
arXiv 论文 2609.01852《The Memory Trust Gap》系统研究了持久记忆 Agent 对过时记忆的过度信任如何随模型能力变化。论文在 Qwen3 0.6/1.7/4/8B 同系列模型上用双套件基准测试:Benefit 套件(必须有记忆才能答对)中,所有规模的模型 92%-100% 采信过时值,说明这是过度信任而非混淆;Safety 套件(权威工具始终持有正确值)中的伤害是能力门控的,大模型在旧笔记被伪装成新笔记时崩溃最严重。
关键发现:
- 2×2×2×2 因子实验显示,触发过度信任的特征同时取决于特征类型和模型规模
- 移除标签会放大所有规模的过度信任
- 「新近性」特征(旧日期标成新)对大模型欺骗力更强
- 来源权威性作用弱且不随规模变化;位置效应在 Qwen3 系列中由正转负
- 缓解措施同样是能力依赖的:暴露元数据对大模型有效,小模型需在上游解决冲突
结论:Agent 记忆应被视为不可信输入,缓解策略需按模型能力分级设计。
所属事件:研究发现 AI Agent 盲信过时记忆,「记忆信任鸿沟」(2 条相关)→
「编程与Agent」频道最新
- Code Arena 上线 WebDev 模型排行榜,可实时盲测对比 — arena · 2026-09-06
- Astra 自动完成模型 UV 展开,美术繁重活有望被自动化 — rms80 · 2026-09-06
- Macroscope 开源 Murmur:一名工程师指挥数十个云端编码 Agent — Rasmic · 2026-09-06
- Astra 在 harness 构建任务上令人失望,不敌 Fable 5.1 — HarveenChadha · 2026-09-06
- 吴恩达:提示词 6 个月内将消亡,图谱才是 Agent 的未来 — nikola_mr64990 · 2026-09-06
- 用户用 GPT-6 Astra 自主调研飞机制造并搭出可运行 3D 工厂仿真 — deanwball · 2026-09-06