ProgramBench评测:Claude 3 Opus单次任务成本高达 50 美元

jyangballin · x · 2026-08-13

由 Meta 超级智能实验室、斯坦福和哈佛联合推出的 ProgramBench 基准测试放出了完整的排行榜、单任务成本及运行轨迹数据。

数据显示,Claude 3 Opus 在执行任务时成本极其昂贵,创下了同类模型的新高:单次任务成本达到 50.53 美元,平均交互轮数高达 257 次,输出 Token 数量达 35.7 万。

所属事件:Claude Opus 5登顶ProgramBench,程序重建能力大幅超越GPT(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →