独立企业级基准 PINNACLE 聚焦多步 Agent 真实完成率与造假追踪
ryanshrout · x · 2026-09-14
Signal65 推出独立基准 PINNACLE,定位是测量企业场景下的真实多步 Agent 任务完成度(做对的事),而非仅看 token 产出或合成跑分。
要点:
- 同时测试开源权重模型(可跑在自己的 GPU 上)与闭源 API,并对比干净数据与脏数据下的表现
- 追踪模型的伪造/编造行为(fabrication),并按每个“正确完成的任务”计价,给出真实的单位成本
- 作者观点:在开源模型被质疑依赖前沿实验室蒸馏的争论下,PINNACLE 这类关于开源模型实际企业效用与成本的客观数据变得更有分量
「模型」频道最新
- 开发者实测 Mercury 2.5:约 13 秒读完病历并纠出 3 处错误 — MaziyarPanahi · 2026-09-14
- OpenAI 官方确认退役 Custom GPTs,推荐迁移到 Plugins — Longjumping_Log9999 · 2026-09-14
- DAIR.ai 创始人:日常工作用 Opus 5 与 GPT-5.6 混搭就够了 — omarsar0 · 2026-09-14
- NovGauge 基准:18 个 LLM 评论文新颖性,幻觉率最高 39% — sethlazar · 2026-09-14
- 开发者好评 GLM 5.3:用起来「感觉像 sol」 — haydendevs · 2026-09-14
- 重度用户观察:Claude Sonnet 近两周在 Claude Code 中表现悄然变好 — DevJedis · 2026-09-14