Signal65 报告:杂乱数据致 AI 代理完成率降 28%
ryanshrout · x · 2026-09-01
Signal65 发布首份 PINNACLE 基准测试报告,测量了 44 种模型配置在企业真实工作流中的表现。
核心发现:
- 在整洁的数据上,9 种模型配置的作业完成率超过 95%。
- 一旦切换到现实世界中杂乱(重复、未迁移、矛盾)的数据,仅有 2 种模型能维持 95% 的完成率。
- 中位数模型在两种条件下的工作流完成率差距约为 28 个百分点。
该基准通过代码评分评估代理在 80+ 轮工具调用、文档阅读和规则应用中的表现,重点在于衡量“正确的工作”而非单纯的能力或吞吐量。
所属事件:Signal65发布企业Agent基准PINNACLE并公布首份实测报告(7 条相关)→
「编程与Agent」频道最新
- 模型只是 Agent 基石,长期运行才是真挑战 — dr_cintas · 2026-09-02
- 应用层模型评估为何难规模化? — Shahules786 · 2026-09-02
- Manager Agent 已过时:顶级模型自带管理能力 — edgarpavlovsky · 2026-09-02
- 构建 Deep Research Agent:搜索层与推理层分离 — hwchase17 · 2026-09-02
- Mem0 与 Supermemory 号称用户众多,真实评测却几乎找不到 — Asly97 · 2026-09-02
- MoM 协议让模型自动路由,HumanEval 成本降 93% — emeka_boris · 2026-09-02