Signal65 实测:开源模型逼近前沿,给「暂停」论泼冷水
ryanshrout · x · 2026-09-15
评测机构 Signal65 在其 agentic 基准 PINNACLE 上公布新一轮结果,正值 OpenAI、xAI、Anthropic 等头部实验室联署呼吁放缓前沿 AI 开发之际。
核心数据:
- 开源权重模型 Qwen3.8-2.4T-A95B 的加权错误数低于 Claude Opus 5
- DeepSeek-V4.1-Flash 在最大算力档较上一代错误减少约三分之一
- Gemini 3.8 Flash 多步任务完成率达 99.6%
- 本轮共评测 8 个新配置,其中 5 个是开源权重,来自 Qwen、DeepSeek 与 Zai
关键论点:「你没测量过前沿,就没法给前沿定速」——PINNACLE 用真实多步企业级工作而非合成任务打分,以代码验证结果,衡量正确产出、速度与成本。测试显示开源模型与托管前沿的差距比「放缓讨论」所承认的更小;当开源权重紧贴前沿时,前沿几乎没有减速空间。对企业选型者而言,本月 agent 工作的优质模型选项比 8 月明显更多。NVIDIA(Blackwell Ultra 为速度测试参考平台)与 AMD 均表态支持该基准。
所属事件:PINNACLE 基准更新:开源模型逼近前沿水平(2 条相关)→
「模型」频道最新
- 用户实测:DeepSeek v4.1 Flash 是「能真正干活」的小模型下限 — solyarisoftware · 2026-09-15
- Raschka 深度解读 GPT-6 Astra:循环深度 transformer 与隐藏思维链 — AxSaucedo · 2026-09-15
- 传 Anthropic 正内测 Opus 5.2,自称较 Opus 5 大幅跃升 — kimmonismus · 2026-09-15
- OpenAI 新模型 88 小时解纳维-斯托克斯,万级 agent 协作引担忧 — ZeroStateReflex · 2026-09-15
- OpenAI 研究员揭秘:实验室员工为何突然集体恐慌 — socoolandawesome · 2026-09-15
- 本地 Qwen 跑编码 agent 频繁跑偏,用户对比后认了 Claude Code — tlpta · 2026-09-15