仅15天:开源Qwen3.8在企业评测四个维度反超Claude Opus 5
ryanshrout · x · 2026-09-16
Signal65 的 PINNACLE 企业评测榜单上,Claude Opus 5 于 8 月 31 日发布即登顶;仅 15 天后,阿里 Qwen 的开源权重模型 Qwen3.8-2.4T-A95B(中等推理档位)就在五个企业 persona 中的四个上超越 Opus 5,第五个持平。
- 具体数据:同一多步企业任务中,该开源模型加权错误率比 Opus 5 低 15%
- 而榜单发布时,最好的开源模型还落后 Opus 5 1.4 倍
- 作者结论:开源权重在两周内追平了当时的最高水平,任何「暂停 AI」的主张都得掂量这个追赶速度
所属事件:开源模型逼近前沿,PINNACLE基准给暂停论泼冷水(3 条相关)→
「模型」频道最新
- Google 语音 AI 支撑 300+ 语言触达 70 亿人,再推新语言研究矩阵 — ymatias · 2026-09-16
- 工程师科普:RLHF 靠真人评估文本,各实验室多年如此 — JFPuget · 2026-09-16
- G2 数据:ChatGPT+Gemini 占 AI 研究市场 81%,Claude NPS 垫底 — sanderssays · 2026-09-16
- Prior Labs 发布 TabPFN-3.5:登顶两大榜单的表格基础模型,支持百万行数据 — tuanacelik · 2026-09-16
- 不输出文字只输出概率:新型基础模型速度 25 倍、成本降近 600 倍 — danshipper · 2026-09-16
- 书生 internlm 发布 Atria-Dawn 预览版:GLM MoE 架构开源模型登 HF 热榜 — internlm · 2026-09-16