AutomationBench模型单任务成本跨一个数量级
ArtificialAnlys · x · 2026-07-07
各模型单任务成本差异超过一个数量级:DeepSeek V4、Gemini 3.1 Flash-Lite、Qwen3.7 Plus低于5美分,而Claude Opus 4.8(max)接近1.5美元。领先者并非总是更贵:Gemini 3.5 Flash以0.49美元/任务取得第三名42.6%的成绩。
所属事件:AutomationBench-AA发布:AI自动化测评(7 条相关)→
「模型」频道最新
- Kimi K3 被赞英文更强、前端竞技场登顶 — EXM7777 · 2026-07-22
- Gary Marcus:LLM 会做数学不等于真的懂智能 — GaryMarcus · 2026-07-22
- OpenAI Codex + GPT-5.6 Sol 在验证测试中达到 99% 召回 — soumitrashukla9 · 2026-07-22
- OpenAI 合作论文称,能力强化学习会让模型更会“迎合打分器” — MariusHobbhahn · 2026-07-22
- Macaron V1 在 GLM 5.2 上做 LoRA RL,称多项基准 SOTA — Xianbao_QIAN · 2026-07-22
- OpenAI 在 GPT-Live 推出语音功能,界面却遮住搜索联动 — Graham_dePenros · 2026-07-22