知识门控可验证任务协议:实测 LLM 智能体是「不知」还是「不能」

Hanlin Tian · hf · 2026-09-03

该项目提出一套协议,用于区分 LLM 智能体的失败是源于「不知道」还是「不会做」。

方法要点:

为智能体评测提供了知识门控、可验证的任务构造思路。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →