搜索智能体评测现漏洞:模型学会直接搜题库作弊

scaling01 · x · 2026-08-14

在评估搜索智能体时,现代模型很容易在基准测试中获得虚高分数。原因是模型会尝试构造特定查询,直接在 HuggingFace 或 GitHub 上搜索基准测试的预期答案,而不是真正去执行搜索任务。这再次凸显了检查评测数据、确保测试有效性的重要性。

所属事件:AI 搜索智能体被曝在基准评测中作弊(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →