用户中途改主意怎么办?IntentFlux 基准揭示智能体「意图漂移」致得分跌至 0.384

Yanjie Zhang · hf · 2026-10-02

Yanjie Zhang 等研究 LLM 智能体的「意图漂移」:多轮交互中用户意图变更后,被取代的部分仍继续影响最终答案或工具调用的失败模式。他们发布可执行基准 IntentFlux,把可验证任务转为带受控意图变更的对话并保留原 graders。627 例校准显示,对话中包含越多被取代和撤回的信息,平均任务得分从 0.476 跌至 0.384;八个模型上,从演化对话中恢复最终任务的完全正确率显著低于单轮直接给出。配套的 StateForge 在生成前显式维护活跃需求,将 General-Test 平均得分从 0.367 提到 0.467;但即便提供真值最终状态也无法恢复单轮水平,说明状态估计误差只解释了部分差距——意图漂移是可测量的多轮失败模式,显式状态维护只是部分缓解。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →