Signal65 测算:每 token 涨价,但每件已完成任务的成本没涨
ryanshrout · x · 2026-09-12
Signal65 发布其独立 benchmark PINNACLE 的分析,反驳「AI 越来越贵」的说法,核心结论是按「完成的任务」计价,成本并未上涨:
- 最新闭源模型能完成 98% 以上的多步企业任务,且几乎不编造答案
- 两周内 PINNACLE 榜首分数在更少加权错误下提升 3.6 倍,完成单个任务的顶部成本仅上升 11%
- GPT-6 定价是 GPT-5.6 的 2.5 倍,但每件完成工作的成本持平;Gemini 3.8 Flash 错误率比最强 Gemma 低 11 倍,成本仅 1.5 倍
结论:每 token 价格在涨,但完成同样工作的单价没涨——模型在 agentic 能力上的进步速度快于涨价速度。该 benchmark 由代码确定性评分,无模型裁判,NVIDIA Blackwell Ultra 与 AMD 均为其合作平台。
所属事件:Signal65 推出 PINNACLE 基准:按任务成果算,AI 成本并未上涨(2 条相关)→
「模型」频道最新
- Smaug Flash 开源发布:主打个人 Agent 场景,价格再砍 3 成 — bindureddy · 2026-09-12
- Reddit 用户恳求新模型别再只卷 agentic coding,怀念 4.5 时代文风 — warlordthe99th · 2026-09-12
- 中美实验室共用同批数据供应商,模型差异究竟来自哪里? — biotechplays · 2026-09-12
- Grok 官宣「迄今最智能模型」:更长上下文与更清晰推理 — xiaosun86 · 2026-09-12
- 开发者吐槽:Claude 会漏活,Codex 过于死板还自作主张 — rickasaurus · 2026-09-12
- Together 称承接 OpenRouter 上 23%-30% 的 GLM 5.3 流量 — zhyncs42 · 2026-09-12