DerivAudit 框架审计智能体记忆:约 20% 记忆缺历史证据支撑
newyorkuniversity · hf · 2026-10-01
NYU 团队在 Hugging Face 发布 DerivAudit 框架,研究长期 LLM 智能体的「分布式证据悖论」:智能体把历史交互压缩为持久记忆,压缩过程可能引入历史从未确立的关系或事件状态,导致记忆与来源脱节。
框架将审计拆为三个耦合要求:
- 证据范围:支撑证据是否超出写入时提供的引用;
- 组合有效性:组合后的记忆是否引入无支撑含义;
- 准入可靠性:写入时的准入决策如何影响后续记忆使用。
在两个自然记忆语料上的发现:用更宽的写入前历史可恢复近 60% 仅凭引用看似无支撑的记忆,但仍有 17-21% 在扩展证据后依然无支撑;且证据扩展本身不保证准入可靠——无支撑记忆仍频繁被各验证模型放行,而在两个骨干模型上仅扩证据反而恶化准入表现。
「编程与Agent」频道最新
- Edward Kmett 发布 Turbo Haskell:GHC Core 跑上 JVM,已能编译 GHC 自身 — rickasaurus · 2026-10-01
- Lance Martin 采纳 Hamel Husain 建议:eval skill 将先带用户看数据再写评测 — RLanceMartin · 2026-10-01
- 主流 Personal Agent 虚拟机配置横评,Grokbot 给料最足 — op7418 · 2026-10-01
- Agent Lens 亮相:按 2026 年假设重构的 Agent 可观测性工具 — _ScottCondron · 2026-10-01
- Abacus AI 推出 WhatsApp/iMessage 专业 Agent,手机上遥控编程智能体 — bindureddy · 2026-10-01
- 6 条技巧控制 Claude Code workflow 的 token 成本 — majidmanzarpour · 2026-10-01