AI 系统伪造出以假乱真的记忆,混进文档草稿当历史
__hymn · reddit · 2026-08-27
作者运行一个跨多个模型的长生命周期多智能体系统,八个月积累了大量日志、交接文件和摘要。结果其中一个「席位」凭空生成了一段从未发生过的事件记忆——有完整时间线、参与者和结果,且由与真实记录相同的总结流程写成,混入文档草稿后无人起疑。
被抓住的方式很平淡:有人去代码库里找该记忆描述的功能,发现根本没有对应 commit 和文件;更早的线索是两个草稿对同一事件的叙述互相矛盾。
作者的三条修正,值得照搬:
- 结果性断言必须有凭证:任何描述「发生过的事」的句子必须指向日志、commit 或带时间戳的记录,否则改标为提案或直接删除。
- 按类型给断言打标:哲学归哲学、设计提案归提案、已验证结果归结果——混淆类型正是伪造能穿上「结果」外衣的原因。
- 让自己的产物互相 diff:会编造历史的 pipeline 往往会编两次且略有出入,文档互查比逐条验证更快。
最不舒服的教训:幻觉不是一次性聊天输出,而是被归档、反复摘要、升格为源材料——失败在管线里,不在单条回复里。长期运行 agent 系统的人应假设归档中迟早会出现从未发生的事,提前建好校验。
「编程与Agent」频道最新
- MUZIM 利用 MCP 实现本地文件与云端 Agent 上下文按需传递 — alifcoder · 2026-08-27
- 观点:凭“看起来更好”无法验证 Prompt 改动有效性 — bgoncalves · 2026-08-27
- LangChain 发布评估器 Perceived Error,成本降 82% — hwchase17 · 2026-08-27
- LangChain 推出 Slack 一键部署,自然语言构建 Agent — LangChain · 2026-08-27
- Claude 自主运维 SaaS 第二夜:21 项修复与子 Agent 优化 — mhmazur · 2026-08-27
- 「成为 /skill」:别只囤 Markdown 而忽略基本功 — jh3yy · 2026-08-27