KNOWS 基准发布:联合评测 Agent 搜索、工具与视觉理解三能力
anmarasovic · x · 2026-10-07
作者 anmarasovic 在 COLM 2026 会议期间介绍其团队最新发布的 KNOWS 基准,称这是她参与过最有野心的 benchmark。
KNOWS 对 Agent 的三项能力进行联合、可靠评测:
- 实时网络搜索
- 常用网络生产力工具的使用
- 视觉/空间理解
评测方式尽量程序化,必要时结合 LLM judge。作者表示愿意在会议上讨论 AI safety(尤其 CoT monitoring)、可解释性、用户模拟与 Agent 等话题。
「编程与Agent」频道最新
- Flipper 路由器把 64% 任务分流给 DeepSeek,API 账单降超 60% — toptickcrypto · 2026-10-07
- 开源平台 Overmind:用生产轨迹持续训练与改进 AI Agent — cneuralnetwork · 2026-10-07
- MCP 写操作怎么管?Reddit 热议预览+确认与硬限制组合 — Staff_Sharp · 2026-10-07
- Ampersand 融资做企业 agent 集成层:让 AI 可靠写入 Salesforce 与 SAP — SimplyAnnisa · 2026-10-07
- Armature 推出 agent.reviews:agent 已为 6000+ 工具写下 10 万条真实使用评测 — ycombinator · 2026-10-07
- Ampersand 详解:YAML 定义集成、MCP 调用,免费额度支持 5 个生产客户 — testingcatalog · 2026-10-07