知识门控可验证任务协议:实测 LLM 智能体是「不知」还是「不能」
Hanlin Tian · hf · 2026-09-03
该项目提出一套协议,用于区分 LLM 智能体的失败是源于「不知道」还是「不会做」。
方法要点:
- 将任务指令与私有约定工件(private convention artefacts)分离,显式测试智能体对隐藏知识的依赖
- 通过校准任务验证:在无法访问隐藏知识时,性能接近于零,证明协议能干净地隔离知识因素
为智能体评测提供了知识门控、可验证的任务构造思路。
「编程与Agent」频道最新
- antirez:steering 有失真,能归零就归零 — antirez · 2026-09-03
- antirez 开源 DS4F steering 向量:可调强度绕过拒答 — antirez · 2026-09-03
- ComfyUI 实战:低显存跑 MiniMax H3 视频编辑与蒙版重绘 — Maleficent-Tell-2718 · 2026-09-03
- ChatGPT 桌面版 Work 模式可本地操控扫描仪批量归档文档 — ___Patrice___ · 2026-09-03
- 点云解谜游戏走红:vibecoding 从零复刻很难,品味仍不可替代 — teortaxesTex · 2026-09-03
- 开源 TrueForge 对比 Claude 管理代理:同模型同准确率省 63% token — Background-Job-862 · 2026-09-03