评测设计新主张:先搭真实世界,再由领域专家写任务
Shahules786 · x · 2026-09-08
Shahules Anwar 提出一个 agent 评测设计观点:Terminal-Bench 和 Harbor 采用的是"任务优先"模式——围绕每个任务搭建一个环境,这对很多评测够用。
但企业级工作需要反过来:先构建一个足够真实的世界(world),让领域专家在这个世界里编写和审核任务——"世界定义任务,而不是任务定义环境"。这是对 agent eval 工程中环境与任务组织方式的方法论主张。
「编程与Agent」频道最新
- 斯坦福免费上线「自我改进 AI 智能体」完整课程 — Saboo_Shubham_ · 2026-09-08
- Claude 做出黏土风 3D 儿童探索游戏,代码与做法全开源 — dotey · 2026-09-08
- Stanford 免费开放「自我改进 AI Agent」完整课程 — Saboo_Shubham_ · 2026-09-08
- Steve Yegge 晒多智能体协作实录:Fable 5.1 重写 30% 代码救场 — Steve_Yegge · 2026-09-08
- Steve Yegge:Fable 5 过后工厂翻车,5.1 烧掉 30% 重写才变快 — Steve_Yegge · 2026-09-08
- 开源 Kwipu:把 Markdown 笔记变成本地 Graph RAG 知识图谱 — tom_doerr · 2026-09-08