ProgramBench评测:Claude 3 Opus单次任务成本高达 50 美元
jyangballin · x · 2026-08-13
由 Meta 超级智能实验室、斯坦福和哈佛联合推出的 ProgramBench 基准测试放出了完整的排行榜、单任务成本及运行轨迹数据。
数据显示,Claude 3 Opus 在执行任务时成本极其昂贵,创下了同类模型的新高:单次任务成本达到 50.53 美元,平均交互轮数高达 257 次,输出 Token 数量达 35.7 万。
所属事件:Claude Opus 5登顶ProgramBench,程序重建能力大幅超越GPT(6 条相关)→
「模型」频道最新
- Claude 3.7 Flash 已上线 Vertex AI 开放测试 — Big-Reason-2976 · 2026-08-13
- 7B 开源视觉模型 SenseNova-Vision:单架构搞定分割、深度与 3D 重建 — SandyL925 · 2026-08-13
- 实测 Gemini 3.7 Flash:Medium 与 High 模式出图质感对比 — Angaisb_ · 2026-08-13
- 开源模型大爆发:Kimi K3、DeepSeek V4 等即将登场 — demian_ai · 2026-08-13
- Mistral 发布 OCR 4.1:精准解析复杂排版与嵌套图像 — FlolightC · 2026-08-13
- 开源真香:MiniMax H3两周登顶该厂下载量榜首 — Pissmaster-69 · 2026-08-13