Signal65 实测:本地小模型 Agentic 能力追平 Claude Opus 5,参数少 13 倍
ryanshrout · x · 2026-10-09
Signal65 的 PINNACLE 测试显示,Qwen3.8-Flash-Next 在中等推理力度下的 agentic 任务得分略高于 7 月发布的 Claude Opus 5 和 9 月的 GPT-6 Sol,且与 2.4 万亿参数的 Qwen3.8 旗舰差距在 5% 以内——参数量少约 13 倍。
- 4-bit 量化版可塞进 128GB 统一内存,正好适配 DGX Spark / RTX Spark 这类设备
- 云端旗舰在最高推理力度下仍更快,错误率低 2-3 倍
- 但对可后台运行的 agent 而言,本地方案在成本与数据控制上已具备竞争力,混合部署方案的价值随每次迭代上升
「Infra」频道最新
- 算力债务高于用户回款,利润或从软件平台回流物理资产方 — LexSokolin · 2026-10-09
- Pixel 9A TPU 跑矩阵乘法:1x1 卷积是压榨算力的最优解 — mgostIH · 2026-10-09
- NVIDIA Dynamo 推出会话感知推理:智能体 KV 缓存跨引擎复用 — PyTorch · 2026-10-09
- 在家攒齐 8 卡 H100 节点,开发者晒本地算力成果 — TheZachMueller · 2026-10-09
- Serverless Horrors:Cloudflare 一张 10811 美元账单 — 7777777phil · 2026-10-09
- DGX Spark 价格被炒上天,转帖直指涨价内幕 — natesiggard · 2026-10-09