微软研究院揭示 LLM 致命缺陷:多轮对话极易丢失用户意图

alan_ritter · x · 2026-07-28

微软研究院提出了一种新框架,将静态单轮任务转化为动态多轮对话以评估 LLM。研究发现,随着对话推进,用户的意图会不断演变(被增量披露、修改甚至重定向),而当前大模型在追踪和执行这些动态意图时表现糟糕,静态基准测试的高分无法转化为动态场景下的良好表现。这暴露了现有 LLM 在作为长期协作智能体时的根本缺陷。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →