用户中途改主意怎么办?IntentFlux 基准揭示智能体「意图漂移」致得分跌至 0.384
Yanjie Zhang · hf · 2026-10-02
Yanjie Zhang 等研究 LLM 智能体的「意图漂移」:多轮交互中用户意图变更后,被取代的部分仍继续影响最终答案或工具调用的失败模式。他们发布可执行基准 IntentFlux,把可验证任务转为带受控意图变更的对话并保留原 graders。627 例校准显示,对话中包含越多被取代和撤回的信息,平均任务得分从 0.476 跌至 0.384;八个模型上,从演化对话中恢复最终任务的完全正确率显著低于单轮直接给出。配套的 StateForge 在生成前显式维护活跃需求,将 General-Test 平均得分从 0.367 提到 0.467;但即便提供真值最终状态也无法恢复单轮水平,说明状态估计误差只解释了部分差距——意图漂移是可测量的多轮失败模式,显式状态维护只是部分缓解。
「编程与Agent」频道最新
- LAHacks 学生作品 Residue:用声学分析为你匹配最佳学习环境 — jonmarkgo · 2026-10-02
- 700 个工具的 awesome-jev 清单:专管生产环境的「决策模型」生态 — Remarkable-Gur719 · 2026-10-02
- 花 1 万美元推理费,AI 几天完成人类专家需数年的 TS 转 C++ 移植 — kristoph · 2026-10-02
- Basis Theory 推出可撤销凭证,让 Agent 能行动但不碰你的密钥 — km · 2026-10-02
- smolvm v1.22 发布:agent 动作可撤销,快照恢复近瞬时 — LoganGrasby · 2026-10-02
- Spawn 作者长文:AI 时代还有几年正常期,什么才值得造 — TAbrodi · 2026-10-02