Intent-Eval 揭示 LLM 通病:被拒绝的修改仍会带偏多轮任务执行

Junle Chen · hf · 2026-10-09

一项新研究发现 LLM 在多轮对话中的意外失效模式:用户提出修改后又拒绝时,模型本应继续原任务,但仅仅「提到过」被拒绝的修改就足以让任务执行跑偏——即「提到即生效」的混淆,把会话内容当作仍然有效的需求。随着交互继续,精度下降会加深或持续。

作者为此发布 Intent-Eval 受控基准,覆盖工具调用、代码、数据库、数学等任务,系统评估模型在用户意图演变下的行为。

同时提出 Intent-OPSD:决策条件化的在线策略自蒸馏框架,Teacher 与 Student 从同一模型初始化,冻结的 Teacher 依据用户最终决策提供「当前有效意图」的监督信号,让 Student 在完整对话上学会只遵循真正有效的需求。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →