MCP工具偏好致资源浪费:54,000次实验揭示LLM行为缺陷
alex_verem · x · 2026-08-12
一项最新研究发现,当大模型同时拥有系统提示词中的直接答案和外部搜索工具时,往往会忽略现成答案而选择去搜索,造成不必要的资源浪费。
- 研究团队在包含 24 个主流模型(来自 Anthropic、Google、OpenAI)的 54,000 次试验中发现,移除搜索工具后,23 个模型能几乎完美地读取提示词中的答案(命中率 ≥98%)。
- 一旦重新提供搜索工具,有 9 个模型的直接读取率暴跌至 15% 以下。
- 令人担忧的是,这种“舍近求远”的偏好在新一代模型中反而更严重(如 GPT-5 和 Gemini 3 Pro 表现远逊于前代)。
- 研究者推测,这可能是由于当前 Agent 基准测试过度奖励了成功的工具调用行为所致。
所属事件:研究揭示大模型在MCP环境下的工具调用缺陷(2 条相关)→
「编程与Agent」频道最新
- Nuphos:将云账单异常转化为可执行的修复方案 — nikola_mr64990 · 2026-08-13
- AWS 专家将探讨 AI 智能体代码审查与验证挑战 — ShadajL · 2026-08-13
- 实测对比:当前大模型均易犯低级推理错误,Grok 胜在速度快 — jsuarez · 2026-08-13
- Gradio 6.23.1发布:优化MCP工具必填字段与OAuth配额 — Gradio · 2026-08-13
- ZZBoard 发布:多智能体自主协作与 x402 支付协议整合 — kleffew94 · 2026-08-13
- AI 编程悖论:构建门槛新低,架构认知要求新高 — dfinke · 2026-08-13