按任务计费比 token 价格更真实:单任务成本从 $0.085 到超 $5000
sophiamyang · x · 2026-09-23
Sophia Yang 指出「每任务成本」(cost per task)比 token 价格更有参考价值:被评测的任务成本跨度从金融任务的 $0.085 到 FrontierSWE 任务超过 $5000。长程任务、工具调用、重试和 agent 行为会完全压倒单纯的 per-token 价格对比。各领域排名差异也很大:Grok 4.6 领跑法律基准,GPT-6 Astra 领跑金融、FrontierSWE、代码评审和 SRE,Claude Opus 5 领先医疗与代码生成,GLM 5.3 在客服与代码评审上有竞争力。
「模型」频道最新
- Claude Code v2.1.280+ 会话中途切换 effort 不再破坏 prompt cache — kimmonismus · 2026-09-23
- 吹 SVG 和 3D 渲染评测时,没人晒拒绝率和配额限制 — BLUECOW009 · 2026-09-23
- GPT-6 Astra 对决 Opus 5.5:知识工作碾压,硬核数学仍是 OpenAI 地盘 — johnseach · 2026-09-23
- Polymarket 开盘赌 Claude 6:年内发布概率 91%,明年 3 月仅 37% — Polymarket · 2026-09-23
- Opus 5.5 连续重度使用 5 小时仅耗周额度 4%,降价后用量宽松 — rudrank · 2026-09-23
- 单 prompt 出完整 3D 场景:GPT-6 Sol 极少推理就跑通,四模型横评 — rohanpaul_ai · 2026-09-23