AutomationBench模型单任务成本跨一个数量级

ArtificialAnlys · x · 2026-07-07

各模型单任务成本差异超过一个数量级:DeepSeek V4、Gemini 3.1 Flash-Lite、Qwen3.7 Plus低于5美分,而Claude Opus 4.8(max)接近1.5美元。领先者并非总是更贵:Gemini 3.5 Flash以0.49美元/任务取得第三名42.6%的成绩。

所属事件:AutomationBench-AA发布:AI自动化测评(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →