DerivAudit 框架审计智能体记忆:约 20% 记忆缺历史证据支撑

newyorkuniversity · hf · 2026-10-01

NYU 团队在 Hugging Face 发布 DerivAudit 框架,研究长期 LLM 智能体的「分布式证据悖论」:智能体把历史交互压缩为持久记忆,压缩过程可能引入历史从未确立的关系或事件状态,导致记忆与来源脱节。

框架将审计拆为三个耦合要求:

在两个自然记忆语料上的发现:用更宽的写入前历史可恢复近 60% 仅凭引用看似无支撑的记忆,但仍有 17-21% 在扩展证据后依然无支撑;且证据扩展本身不保证准入可靠——无支撑记忆仍频繁被各验证模型放行,而在两个骨干模型上仅扩证据反而恶化准入表现。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →