KNOWS 基准发布:联合评测 Agent 搜索、工具与视觉理解三能力

anmarasovic · x · 2026-10-07

作者 anmarasovic 在 COLM 2026 会议期间介绍其团队最新发布的 KNOWS 基准,称这是她参与过最有野心的 benchmark。

KNOWS 对 Agent 的三项能力进行联合、可靠评测:

评测方式尽量程序化,必要时结合 LLM judge。作者表示愿意在会议上讨论 AI safety(尤其 CoT monitoring)、可解释性、用户模拟与 Agent 等话题。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →