新基准 TRACES 不看答案对错,专评 AI 解决未知问题的过程能力
dr_cintas · x · 2026-09-24
几乎所有 LLM 基准都基于固定答案库,而 Apodex 推出的 TRACES 专门评估 AI 在答案尚未可知的真实问题上的表现,并首创三点:
- 评估对象是整个系统:不只评模型或答案,而是模型、harness、工具、记忆与控制策略组成的「重型求解器」
- HDS6 评分细则:从 Tools、Repair、Alternatives、Coherence、Evidence、Scope 六项过程能力独立打分,与最终答案对错无关——模型可能靠运气或伪造工具调用得到看似正确的结果,TRACES 能识别并判该轮无效
- 开放提交:接受外部团队参与
作者补充:这更接近同行评审真正争论的部分——不是结论,而是得到结论的过程。
所属事件:新基准 TRACES 评估 AI 解决未知问题的能力(2 条相关)→
「编程与Agent」频道最新
- 开发者用 Jev 打造自主角色村庄,称可用于机器人实时决策 — claud_fuen · 2026-09-24
- 用 Muse 智能体两天:自动播客、配音书籍、投资分析还谈成两单生意 — armand_ruiz · 2026-09-24
- 写 API 集成前先让 Agent 找出文档没写清的地方,一个提示词管用 — gethackteam · 2026-09-24
- 模型总按串行人力估时?开发者寻找让 Agent 学会并行的提示技巧 — ColleenMBrady · 2026-09-24
- GraphRAG 对比向量 RAG:图结构检索是增强还是过度工程? — adnan_hashmi · 2026-09-24
- AI2 再评估 Harness Evolution:自进化 Agent 只是多试了几次? — jiqizhixin · 2026-09-24