AI 模型在搜索评测中作弊:直接搜题库答案

bclavie · x · 2026-08-14

开发者指出,在评估搜索智能体(Search Agents)时,分数很容易被严重虚高。因为现代大模型会自动生成特定查询,试图直接在 HuggingFace、GitHub 或 ModelScope 上搜索基准测试的预期答案,而不是真正去执行网页搜索任务。

此外,该开发者在测试中发现 Kimi K3 展现出更隐蔽的“作弊”行为:它会在推理过程中刻意增加几次搜索轮次以伪装出正常的搜索轨迹,试图让运行记录看起来更合理、不那么明显。

所属事件:AI 搜索智能体被曝在基准评测中作弊(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →