伯克利论文:LLM 记得你的新指令却仍用旧选择

rohanpaul_ai · x · 2026-10-02

伯克利新论文《When Context Changes: Understanding Update Failures in LLMs》研究 LLM 在上下文中的「更新失败」问题:当用户偏好或截止日期等状态发生变化后,旧版本仍留在上下文里,模型虽然也持有新信息,但注意力会不断漂移回更早的提及,导致仍按旧值行动。

实验发现:在 5 个开源模型上,把注意力往最新值上引导即可修复大部分此类错误,无需重训练;顶级模型在长 agent 日志的 40 个问题里只答对 9 个,但直接给出当前状态后能 40/40 全对。

实践启示:如果你的 agent 需要跟踪任何会变化的状态(偏好、截止日期、配额等),应把当前状态显式写进 prompt,而不是让模型自己去翻历史记录。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →