删掉错误源头也救不回对话:上下文污染基准 72 例实证
Lopsided_Scarcity979 · reddit · 2026-08-20
作者把「上下文污染」当上下文工程问题做了试点基准:错误信息若已被后续轮次复述、推导或总结,仅删除源头消息无法修复。
实验设计:9 个合成任务族、传播深度 1–3 层,同一问题在 5 种条件下测试(干净、污染、仅删源头、剪除污染子图、按依赖顺序重算)。核心例子是零件数从 30 被更正为 24 后又被错误轮次恢复为 30,后续轮次继续算出 120、131 并当作当前状态。4 个模型端点、temperature 0,共 540 个条件,筛出 72 个「干净时对、污染后错」的配对案例。
结果:仅删源头修复 68/72;删源头并重算后代 71/72;剪除整个污染子图 72/72。旗舰案例中 Gemma 4 26B 与 GPT-OSS 20B 在源头已删后仍答 131——但这不是隐藏记忆,错误值 30 仍显式存在于序列化上下文里。
结论:删除错误证据与修复由它衍生的文本是两个不同操作,上下文管理系统需要显式的失效机制(标记过期、剪子图、按依赖序重生成)。作者也坦承局限:合成任务、单次采样、未归一化推理设置,并计划加入长度匹配对照与本地模型赛道。
「编程与Agent」频道最新
- AI 难以自动解决启动故障,仍需人工介入调试 — lucasmeijer · 2026-08-20
- Teknium 支招:agent 用云浏览器后端,自带验证码破解与住宅 IP — Teknium · 2026-08-20
- SkillGate 解决长视距 Agent 技能选择饥饿 — SJTU · 2026-08-20
- Voice Agent 跨国部署:统一架构还是分市场独立? — Warm-Moose6028 · 2026-08-20
- Hermes 集成 SkillEvaluator,安装技能前先审代码 — max_paperclips · 2026-08-20
- 求助:如何搭建纯内网文档 AI Agent — Remarkable_Mine_1622 · 2026-08-20