会计任务大考:58%难题无模型能解,Claude居首
EdwardSun0909 · x · 2026-08-01
Mercor 发布了针对会计任务的 AI 智能体基准测试 APEX-Accounting。测试包含 10 个商业环境和 160 个月末结账任务,要求 AI 跨应用推理并处理不完整记录。
结果显示,当前前沿模型仍无法可靠完成专业会计工作:58% 的任务在任何模型的 8 次尝试中均未通过。表现最好的 Anthropic Fable 5 也仅满足了 56.4% 的评分标准,Meta Muse Spark 1.1 (52.6%) 和 OpenAI GPT-5.6 (51.5%) 紧随其后。此外,模型偶尔能解出难题,但几乎无法在多次尝试中保持一致性。
「模型」频道最新
- DeepSeek 疑似 V4-Flash 模型测试端点曝光 — victormustar · 2026-08-01
- 马斯克官宣 Grok 4.5:跑分超 GPT-5.6 并推出终端编程智能体 — elonmusk · 2026-08-01
- OpenAI 模型降价 80%:技术突破还是价格战? — Tight-Grocery9053 · 2026-08-01
- Kimi K3推理加速升级:百万上下文性能不再衰减,下载量破14万 — BanghuaZ · 2026-08-01
- 实测Claude Opus隐藏提示词,生成诡异“Dario与Amanda”图像 — chicametipo · 2026-08-01
- 开源模型逼宫?网友调侃某厂商因DeepSeek被迫降价80% — InternationalGap3698 · 2026-08-01