PINNACLE 智能体基准更新:Qwen3.8 错误率比 Claude Opus 5 低 15%
ryanshrout · x · 2026-09-15
Signal65 发布新版 PINNACLE 智能体基准,测评了 8 个新模型配置,其中 5 个是开源权重,来自 Qwen、DeepSeek 和 Zai。
核心数据:Qwen3.8 在测试中错误率比 Claude Opus 5 低 15%,其 180B 兄弟模型可在桌面端运行。作者据此认为开源权重已逼近托管前沿,OpenAI、xAI、Anthropic 三家呼吁「放缓前沿开发」的协议若要落地,杠杆在能自持硬件的一方手里。
所属事件:PINNACLE 基准更新:开源模型逼近前沿水平(2 条相关)→
「模型」频道最新
- 为什么让 AI 提炼三条结论还要等十分钟:Prefill 与 Decode 机制解析 — dotey · 2026-09-15
- 爆料称 xAI 落后 OpenAI 与 Anthropic 约 6-12 个月 — sachinmaya1980 · 2026-09-15
- 博主补充:astra 与 fable 表现不如上周,疑似能力回退 — willcb · 2026-09-15
- 博主感叹:astra 与 fable 今天已触及能力前沿 — willcb · 2026-09-15
- 用户指控 Claude Artifacts 静默上传未完成草稿且开关被禁用 — maier_ak · 2026-09-15
- Kimi K3 上线 NVIDIA NIM,可免费调用 OpenAI 兼容接口 — airesearch12 · 2026-09-15