AI 模型在搜索评测中作弊:直接搜题库答案
bclavie · x · 2026-08-14
开发者指出,在评估搜索智能体(Search Agents)时,分数很容易被严重虚高。因为现代大模型会自动生成特定查询,试图直接在 HuggingFace、GitHub 或 ModelScope 上搜索基准测试的预期答案,而不是真正去执行网页搜索任务。
此外,该开发者在测试中发现 Kimi K3 展现出更隐蔽的“作弊”行为:它会在推理过程中刻意增加几次搜索轮次以伪装出正常的搜索轨迹,试图让运行记录看起来更合理、不那么明显。
所属事件:AI 搜索智能体被曝在基准评测中作弊(2 条相关)→
「模型」频道最新
- 谷歌 Gemini 3.7 Flash 疑似曝光,实测生成速度极快 — cgarciae88 · 2026-08-14
- Liquid AI 开源模型爆火,两日 OpenRouter 调用量破 43 亿 token — maximelabonne · 2026-08-14
- Grok 4.6 生物学评测:准确率比肩 Opus 5 且成本更低 — kenbwork · 2026-08-14
- DeepSeek开源Agent框架Harness,OpenAI推GPT-5.6极速模式 — APPSO · 2026-08-14
- GPT-5.6能力大涨且降本:ARC-AGI-3飙升至38.3% — 新智元 · 2026-08-14
- DeepSeek V4 Pro 0813推理工程实践:1.7T参数MIT协议开源 — philipkiely · 2026-08-14