PINNACLE 智能体基准更新:Qwen3.8 错误率比 Claude Opus 5 低 15%

ryanshrout · x · 2026-09-15

Signal65 发布新版 PINNACLE 智能体基准,测评了 8 个新模型配置,其中 5 个是开源权重,来自 Qwen、DeepSeek 和 Zai。

核心数据:Qwen3.8 在测试中错误率比 Claude Opus 5 低 15%,其 180B 兄弟模型可在桌面端运行。作者据此认为开源权重已逼近托管前沿,OpenAI、xAI、Anthropic 三家呼吁「放缓前沿开发」的协议若要落地,杠杆在能自持硬件的一方手里。

所属事件:PINNACLE 基准更新:开源模型逼近前沿水平(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →